Signal Feed

#智能体 主题信号第 3 页

围绕 智能体 的精选动态、来源摘要和重要性判断。

动态列表

01

纳德拉重述微软 AI 生态战略

微软 CEO 纳德拉在 Build 2026 访谈中提出 AI 战略九大支柱:生态系统优于单一模型、需重构 IDE 以支持百并发代理会话、哈尼斯成核心产品、私有评测为核心 IP、代理轨迹可入资产负债表、SaaS 解绑重组、结果定价存回归风险、买建决策量化、通用型工程师杠杆增大。微软将自身定位为评测与哈尼斯公司,M-dash 实测发现现有扫...

twitter关注列表2026年06月11日 06:30#行业动态#大模型#智能体
观察
02

AI Agent 正在改变知识工作

Perplexity 与 Harvard Business School 基于 Perplexity Computer 和 Search 的真实使用数据,首次系统比较了「对话助手」与「通用 Agent」对知识工作的影响。研究使用 1 万对初始查询相似的会话、8 个职业集群、8000 名用户样本,并结合 25 位活跃用户访谈,发现 Comp...

twitter关注列表2026年06月10日 08:27#研究#智能体#行业动态
值得跟进
03

Kocoro 开源 Agent 引擎实现跨日记忆的目标

Kocoro 开源 Agent 引擎通过TensorLogic训练的轻量级记忆模型实现 macOS 端跨日历记忆功能,将日常工作会话(包括项目状态、工具使用记录和多应用交互操作)持续保存至本地,并提供CLI和GUI两种使用方式,开源核心模块(shan runtime)支持可视化审计与可配置控制,目前桌面端产品Kocoro Desktop为...

twitter关注列表2026年06月10日 00:52#智能体#工具
观察
04

Browser Use 重写架构

Browser Use 团队宣布将 Browser Use 从头用 Rust 重建。新版本 0.13.0 保持相同接口,但架构完全重写,采用 Custom Rust harness + TUI、Direct CDP control 和 Full browser action space,并加入失败自恢复能力。团队对比称旧版依赖 prede...

twitter关注列表2026年06月09日 06:25#开发者工具#智能体#产品更新
观察
05

Paving the way for agents in biology

Anthropic 的 Laura Luebbert 基于 Ferdous Nasri、Sarah Gurev、Patrick Varilly、Krithik Ramesh、Nuala A. O’Leary、Jonah Cool、Bernhard Y. Renard、Pardis Sabeti 和 Laura Luebbert 的研究,讨...

Anthropic-research2026年06月08日 21:20#技术报告#智能体#研究
观察
06

Learning Agent-Compatible Context Manageme

论文提出 AdaCoM:在不重新训练主 agent 的情况下,用一个独立的小型 LLM 在每一步动作前编辑 agent 的工作上下文。该方法把上下文管理外置为一个训练过的 manager,对任务历史进行 rewrite、merge、prune 或 preserve,再把清理后的上下文交给冻结的 agent。作者在 web search 和...

twitter关注列表2026年06月09日 04:23#研究突破#智能体#技术
观察
07

Anthropic 生物学研究

Anthropic 的研究指出,AI agents 在代码任务上看似表现出色,但在生物学检索任务中会在科学分析开始前就失败。以一个 Ebola 序列任务为例,Claude Sonnet 4 在同一请求下分别返回 106、15 和 5 条序列,而预期答案是 266 条;这类缺失会把后续科学结论带偏,例如一次错误检索把疫情溯源推到了 1922...

twitter关注列表2026年06月09日 04:57#研究#智能体#技术
观察
08

Nex-N2 开源

Nex AGI 将 Nex-N2 开源,这是一个面向 coding、tool use、deep research 和 long-horizon workflows 的 agentic model series。该系列包含 Nex-N2-Pro,参数规模为 397B total、17B active,以及 Nex-N2-mini,35B t...

twitter关注列表2026年06月08日 15:12#开源#模型发布#智能体
值得跟进
09

AGENTS.md 在 Coding Agents 中真的有用吗?

一项论文做了大规模实证研究,评估仓库级上下文文件 AGENTS.md、CLAUDE.md 等对编码 Agent 的影响,使用了 SWE-bench Lite(300 个任务、11 个热门 Python 仓库)和新建的 AGENTBENCH(138 个任务、12 个已含开发者 context file 的冷门仓库)。研究比较了三种条件:无 ...

twitter关注列表2026年06月08日 09:07#研究#智能体#技术
值得跟进
10

BestBlogs 早报 · 06-08

BestBlogs 早报汇集了 Tony Fadell 对产品直觉的见解、OpenAI 内部 Codex 驱动的 100 万行代码项目(效率提升约 10 倍)、Thoughtworks 对 Coding Agent 范式转移的分析(AI 开发成本从 0.12 美分飙升至年均近 9 万美元)等要点。此外,Anthropic 首次公开内部 C...

twitter关注列表2026年06月08日 07:16#行业动态#技术#智能体
观察
11

OpenAI准备对ChatGPT进行规模最大改版

据英国金融时报报道,OpenAI计划对ChatGPT进行自推出以来最大规模的改版,将其转型为集成编码工具和AI代理的“超级应用”,并新增高管认为具有增强收入潜力的产品功能。新版本将兼具代码生成能力和智能体自动化操作,并会增加能带来更多盈利的产品模块。

twitter关注列表2026年06月07日 12:20#模型发布#技术报告#智能体
值得跟进
12

BestBlogs 早报 06-06

腾讯高级执行副总裁汤道生与首席 AI 科学家姚顺雨围绕腾讯 AI 的下半场展开对谈,讨论了从“解决问题”转向“定义问题”、模型与产品的 Co-Design、Agent 演进与性价比,以及腾讯在 AI 时代的战略节奏与组织变革。文中同时提到,Hy3 preview 在 CodeBuddy 与 WorkBuddy 上首 token 延迟降低 ...

twitter关注列表2026年06月06日 07:35#行业动态#智能体#产品更新
观察
13

MIT 自修订 AI 科学框架

MIT 团队在 arXiv:2606.01444 发表论文《Self-Revising Discovery Systems for Science: A Categorical Framework for Agentic Artificial Intelligence》,提出一种可自我修订的 AI 科学家框架。该框架不只在固定科学词汇空间...

twitter关注列表2026年06月06日 05:48#研究#技术报告#智能体
观察
14

Agent Arena 上线

Arena 发布了一个面向真实工作场景的 agent 排行榜,用来衡量 AI 模型完成实际用户任务的能力,而不是孤立基准题。该系统跟踪模型在 web search、文件、terminal 等工具下处理写代码、做应用、研究、写文档、分析文件等任务的表现,并通过因果推断综合 5 个信号:任务成功、赞扬与投诉、纠错跟随、terminal 错误恢...

twitter关注列表2026年06月06日 06:01#基准测试#智能体#技术报告
值得跟进
15

Meta-Agent Challenge

研究团队提出 Meta-Agent Challenge(MAC),为一个 coding agent 提供 sandbox、evaluation API 和时间预算,要求它编写一个 agent,在 5 个领域的 held-out performance 上尽可能最优。结果显示,meta-agents 很少能达到 human-engineer...

twitter关注列表2026年06月05日 23:28#研究#智能体#技术
观察
16

Agents' Last Exam

DAIR.AI 发布了 Agents' Last Exam(ALE),这是一个持续更新的基准,包含 1,000+ 个具有经济价值的任务,并由 250+ 位行业专家构建,且映射到美国联邦职业分类体系。该基准中最难的层级在主流 harness 和 backbone 上的平均 full pass rate 仅为 2.6%。作者将其定位为更接近 ...

twitter关注列表2026年06月05日 23:18#基准测试#智能体#研究
观察
17

腾讯混元开源PlanningBench评估LLM规划能力

腾讯混元联合人民大学高瓴人工智能学院开源了PlanningBench框架,用于评估和训练大语言模型的真实规划能力。该框架包含30多个真实世界规划任务,涵盖调度、生产、旅行、资源分配、应急响应等六大类别,每个任务都有明确的成功标准和全自动验证机制,可用于模型评估和继续微调,也已在arXiv、GitHub和Hugging Face上开放。

twitter关注列表2026年06月05日 19:58#开源#技术突破#智能体
观察
18

孙正义谈Physical AI机会

孙正义在巴黎表示,AI下一波最大机会是Physical AI和机器人,当前市场规模20-30亿美元,预测2035年达2000亿,乐观10年内破万亿;中国已将单台成本压至5万美元,软件AI红利窗口走向成熟,Physical AI是未来重点。

twitter关注列表2026年06月05日 11:49#行业动态#分析#智能体
观察
19

Harness-1: Reinforcement Learning for Sear

论文《Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses》提出把搜索智能体中的记忆与状态管理从模型内部移到外部 harness 中。作者指出,普通搜索智能体需要在同一上下文里同时完成下一步搜索决策和记录文档、线索、失败...

twitter关注列表2026年06月05日 09:24#智能体#研究突破#技术报告
观察
20

Codex 的 Build iOS Apps 插件

OpenAI Developers 介绍 Codex 新增的 Build iOS Apps 插件,可在 Codex 内置浏览器中查看和测试 iOS 应用,打开 SwiftUI previews,并在不离开 Codex 的情况下对编辑内容进行热重载。该插件通过第三方 npm serve-sim 将真实运行中的 iOS Simulator 画...

twitter关注列表2026年06月05日 04:17#产品更新#开发者工具#智能体
值得跟进