Vercel 开源 Agent 框架 Eve
Vercel 开源了其 Agent 框架 Eve,采用“Agent 即目录”的设计理念,内置持久会话、沙箱、Human-in-the-loop、多 Channel 等生产级能力。内部应用数据显示:d0 每月处理 3 万+ 询问,Lead Agent 年成本约 $5k 回报约 32 倍,Vertex 解决了约 92% 的工单。
围绕 智能体 的精选动态、来源摘要和重要性判断。
Vercel 开源了其 Agent 框架 Eve,采用“Agent 即目录”的设计理念,内置持久会话、沙箱、Human-in-the-loop、多 Channel 等生产级能力。内部应用数据显示:d0 每月处理 3 万+ 询问,Lead Agent 年成本约 $5k 回报约 32 倍,Vertex 解决了约 92% 的工单。
Apodex 发布了一个名为 Apodex 的深度研究系统,支持最多 150 个子 Agent 并行探索,总步数达 15,000 步,内置三层自我验证机制。在 BrowseComp 上超越 GPT-5.5-pro,在 DeepSearchQA 上超越 Claude-Opus-4.8 和 Kimi-K2.6,并在 FutureX 竞赛中包揽...
DAIR.AI 介绍 PreAct 方法,将计算机使用智能体的首次成功运行编译为小型状态机程序,后续任务直接回放,速度提升 8.5-13 倍,无每步语言模型调用,并保持屏幕校验,不一致时退回原始推理。
Block 构建了名为 Builderbot 的 AI 系统,通过协调多个 agent 跨代码库工作,实现每天 20 万次操作,每周合并 1500 个 PR,占所有生产代码变更的 15%,开发周期从数月缩短至数天。
NVIDIA GEAR实验室的ENPIRE系统通过8个机器人集群实现物理世界AutoResearch,系统包含两层安全机制(硬运动学限制和扭矩限制)和基于演示学习的冻结奖励函数,并定义了MRU、MTU等遥测指标以优化资源利用。
Elon Musk 转发推文称 Grok 已集成到 Microsoft Office(PowerPoint、Word、Excel),侧边栏提供智能体,可根据提示生成文档、表格、演示文稿,支持实时数据、图像生成,并连接自有应用和 MCP 服务器,对 SuperGrok、Heavy、Business 和 Enterprise 订阅用户可用。
Anthropic 基于约 40 万次 Claude Code 会话(2025 年 10 月-2026 年 4 月)分析指出,在交互式编码中,领域专业知识比编程能力更能决定成功率,专家与中等水平用户差距不大;任务价值平均提升约 25%。
NotebookLM 向全球 Google AI Ultra 订阅用户全量推送更新。新版本由 Gemini 3.5 和 Antigravity 驱动,提升了 AI 思维过程的可视化程度,并为每个笔记本提供包含 100+ 软件技能的安全云计算机以支持复杂分析。
Victor Su-Ortiz 构建了一个使用 MiniMax M3 进行推理、Parakeet 进行语音转文本、MiniMax Speech 2.8 进行语音合成的 Mac 顶栏应用,实现网站设计审查、反馈和自动代码修补;切换 STT 至 Together AI 后延迟从 546ms 降至 277ms。
Novita AI 宣布 Z.ai 的 GLM-5.2 已上线 Novita,并称 Novita 是 Day-0 启动合作伙伴。原文披露 GLM-5.2 具备 1M-token 上下文窗口,面向长周期自主任务和长周期编码助手,声称具备前沿级编码和智能体能力。
Microsoft 在 2026/06/16 宣布 Copilot Cowork 全球正式上线,并加入多模型支持。该服务面向任何组织,可运行长时间运行智能体处理复杂多步骤任务,并以组织独有知识和经验作为依据。
从6月15日起,Claude 将 Agent SDK 和 Claude -p 的用量从 Claude 订阅套餐额度中拆出,此前批量任务会占用日常对话配额,现在两者互不影响。新规则为 Pro 用户每月提供 $20 专用额度,Max 5x 为 $100,额度用完才开始扣其他费用,未用完不滚存到下个月,需一次性手动领取后自动续期。覆盖范围包括 ...
Vercel 推出基于 AI SDK 7 实验 API 的 Generative UI Agent Harness,实现 Claude Code/Codex/Pi 在沙箱中执行真实操作并生成结构化 UI 组件,采用三层解耦架构(HarnessAgent、Sandbox、json-render),前端可实时渲染步骤、diff、终端等组件。
Sakana AI 推出其首个商业产品 Sakana Marlin,这是一个自主“超深研究”智能体,基于 AB-MCTS(NeurIPS 2025 Spotlight)和 AI Scientist(Nature)技术,可连续自主推理长达 8 小时,生成数十页研究报告和结构化幻灯片。产品提供按次付费及 Pro、Team、Enterprise...
Jeffrey.Calm分享其Codex Agent与官方仓库的Code Review Bot和Hotfix Bot协作,自动完成从提issue到修复merge的全流程,人类仅回复OK。
Univ of Texas 论文发现 AI agent 在部署后即使模型不变,也会因记忆管理(摘要、合并、更新、维护)逐渐变得不可靠,并提出 AgingBench 基准来评估 agent 跨会话的可靠性下降问题。
Sakana AI 发布首个商业产品 Sakana Marlin,一款面向企业的自主型深度研究代理,定位为"虚拟CSO",旨在进行"超深度研究"。
Sakana AI 发布首款商用产品 Sakana Marlin,一个面向企业的自主研究助手,用户只需设定调查主题即可运行最长约 8 小时的自主研究,并生成结构化摘要幻灯片和数十页研究报告。该产品面向原本由 CSO 与数人团队用数周完成的战略调查场景,基于 Sakana AI 的长期推理研究及 AB-MCTS 等多模型协作推理技术。Sak...
Telegram 发布更新,使机器人支持富文本输出,包括表格、清单、嵌套引用块、行内插图、图片轮播、拼图、可折叠段落、脚注、标题锚点、数学公式和上下标。单条消息最多 32768 个字符,超过 8000 字会自动折叠为“显示更多”按钮,Telegram 也推出手表端应用。投票选项可包含链接,内置浏览器可直接渲染 .md 文件,长按链接可临时...
Dawn Song 发布 Agents' Last Exam (ALE) 基准测试,在 55 个职业的 1,500 多个专家任务中评估 Fable 5, GPT-5.5, Composer 2.5 等 Agent 的实操能力。结果显示在最难级别任务中,所有 frontier agent 的成功率均为 0%,距离人类水平仍有显著差距。