本期判断
本期日报聚焦AI模型性能提升与商业策略进展。Sakana AI发布Fugu-Ultra v1.1超越竞品,Anthropic通过新工具提升Claude模型准确率。DeepSeek披露其国产化算力布局及高毛利率。同时,OpenRouter展示了惊人的市场增长,并有新的多智能体研究与开源工具发布。
模型与研究
Sakana AI发布Fugu-Ultra v1.1,性能超越Fable 5
Sakana AI 发布 Fugu-Ultra v1.1 模型,通过动态编排最新前沿模型,性能比 v1.0 提升最多7.9分。该模型在复杂编码(ProgramBench)和推理任务(Terminal Bench 2.1)上超越 Claude Fable 5,且价格保持不变。
论文:信息瓶颈视角分析多Agent系统
一篇论文通过信息瓶颈视角,在5个基准测试、3种模型大小、18个测试中比较了单Agent与多Agent系统性能。研究发现多Agent系统在信息传递紧凑完整时对弱模型尤其有效,但若后续步骤需精确早期细节,其优势可能减弱或逆转。
产品更新
ClaudeDevs更新缩放工具,Fable 5准确率提升至73%
ClaudeDevs 更新了缩放工具 Cookbook,使 Claude 模型在 Chartography 基准测试(100道难题)上表现显著提升。其中,Claude Fable 5 准确率从 29% 提升至 73%,Sonnet 5 准确率从 13% 提升至 44%。
Anthropic升级Claude语音模式支持Opus与Sonnet
Anthropic 升级 Claude 语音模式,现已支持其旗舰模型 Opus 和 Sonnet,提升了语音交互能力。
智能体与工具
Andrew Ng推出开源智能体OpenWorker
Andrew Ng 宣布推出开源智能体 OpenWorker,进一步推动 AI 智能体在开源社区的发展与应用。
阿里开源Agent评测框架skill-up
阿里巴巴开源了 Agent 评测框架 skill-up,该框架在内部已将1200行代码收敛为声明式,旨在提高 Agent 开发与评估效率。
商业与市场
OpenRouter月使用量18个月增长125倍
OpenRouter公布其月度 token 使用量数据,从2025年1月的2T增长至2026年7月的250T,在18个月内实现了125倍的增长。
DeepSeek投资人电话会泄露:国产替代与算力策略
DeepSeek投资者电话会泄露数据显示,截至5月用2万张Hopper等效卡训练出一线模型,推理毛利率约85%,硬件10个月回本。公司已锁定1.6万张华为950卡,并将TileLang编译器生态迁移至华为,创始人梁文锋断言CUDA护城河一年内瓦解,并透露DeepSeek将Agent持续学习作为下一目标,同时承认算力与数据约束。