Signal Brief

Claude开发者分享两种多智能体模式

Claude 开发者团队分享了两种多智能体模式:Advisor(Sonnet 5 执行,Fable 5 提供建议)和 Orchestrator(Fable 5 规划,Sonnet 5 执行)。在 SWE-bench Pro 上,Advisor 模式实现 84% 准确率,成本 $1.40,达到 Fab...

twitter关注列表 meng shao (@shao__meng) 发布 2026-07-08 收录 2026-07-08 观察

一句话判断

差异点:提供了两种多智能体模式的具体成本-性能权衡数据,可指导实际部署选型。

核心信息

Claude 开发者团队分享了两种多智能体模式:Advisor(Sonnet 5 执行,Fable 5 提供建议)和 Orchestrator(Fable 5 规划,Sonnet 5 执行)。在 SWE-bench Pro 上,Advisor 模式实现 84% 准确率,成本 $1.40,达到 Fable 5 单独性能的 92%,成本仅 63%;Orchestrator 模式在 BrowseComp 上实现 86.8% 准确率,成本 $18.53,达到 Fable 5 单独性能的 96%,成本仅 46%。

原始内容

Claude 开发者官方分享:团队内部高频使用这两种经典多智能体模式「Advisor」和「Orchestrator」来发挥 Fable 5 最高价值、同时把成本降到最低! # 模式一:Advisor(顾问)模式 —— 自下而上的求助 架构:Sonnet 5 作为执行者跑主循环,遇到需要高层判断时,通过 tool call 调用 Fable 5 获取建议,Fable 5 返回"指导意见"后继续执行。 关键特征: · 方向:Executor → Advisor(执行者主动求助) · Fable 5 调用频率低,大约每个任务只调用一次,用于"纠偏/定方向" · 绝大多数 token 按 Sonnet 5 的低价计费 实证数据(SWE-bench Pro,482 题): · Sonnet 5 单独:~75.5%,~$0.75 · Sonnet 5 + Fable advisor:~84%,~$1.40 · Fable 5 单独:~91.5%,~$2.25 结论:组合方案拿到 Fable 5 单独约 92% 的分数,但只需约 63% 的价格。 # 模式二:Orchestrator(编排者)模式 —— 自上而下的委派 架构:Fable 5 作为编排者做规划,然后把任务"扇出(fan out)"委托给多个 Sonnet 5 worker 执行,每个 worker 跑自己的执行循环。 关键特征: · 方向:Orchestrator → Workers(编排者主动委派) · Fable 5 负责"规划",token 消耗大的实际研究/执行交给 Sonnet 5 · 适合研究类、可并行的批量任务 实证数据(BrowseComp 完整集): · 全 Sonnet 5:77.8%,$16.01 · Fable 5 lead + Sonnet 5 workers:86.8%,$18.53 · 全 Fable 5:90.8%,$40.56 结论:编排方案拿到 Fable 5 单独约 96% 的性能,但只需约 46% 的价格;相比纯 Sonnet 5,准确率提升约 9 个百分点,成本仅增加约 $2.5。 # 两种模式的对比 1. 控制流方向 Advisor 模式:执行者向上求助 Orchestrator 模式:编排者向下委派 2. Fable 5 角色 Advisor 模式:被动提供指导 Orchestrator 模式:主动规划分配 3. Fable 5 调用频率 Advisor 模式:低(约一次/任务) Orchestrator 模式:规划阶段集中使用 4. 适合场景 Advisor 模式:单任务中需要高层纠偏 Orchestrator 模式:可拆分、可并行的研究/批处理 5. 性价比口诀 Advisor 模式:92% 性能 / 63% 价格 Orchestrator 模式:96% 性能 / 46% 价格 ![photo](https://pbs.twimg.com/media/HMqtZxRbYAAe5f7.jpg) > **引用原帖 ClaudeDevs (@ClaudeDevs):** > A few patterns we frequently use with Fable 5: > Use Fable 5 as an "advisor." > An executor (Sonnet 5) calls Fable 5 for guidance. > Most tokens are billed at the lower executor rate. https://t.co/JIiZ2gm99Y > https://x.com/ClaudeDevs/status/2074606058128224365

相关动态

01

Kimi K3 在 SpreadsheetBench 2 上排名第一

Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。

twitter关注列表2026-07-18#模型#技术突破#评测
观察
02

Mind Lab 开源长文本强化学习项目

Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。

twitter关注列表2026-07-17#开源#技术突破#模型
观察
03

Kimi K3非对称竞争分析

Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...

twitter关注列表2026-07-18#AI#模型#技术突破
观察
04

AI 代码生成大势所趋

Greg Isenberg 发文指出,相比一年前的手写代码实践,如今大多数工程代码已由 AI 生成,标志着编程范式的根本转变。他援引了 Google 75% 新代码由 AI 生成、Anthropic 90%+ 代码由 Claude 编写、GitClear 代码重复率上升 81% 复用率下降 70% 等具体数据,并引用 Dario Amod...

twitter关注列表2026-07-18#技术突破#行业动态#分析
观察
05

开源模型长期网络能力差距缩小至4-7个月

长期网络能力方面,领先开源模型落后闭源前沿从2025年大部分时间的6-10个月缩短至4-7个月。GLM-5.2匹配了约4个月前发布的闭源模型。AI安全研究所的32步“The Last Ones”任务中,GPT-5.6 Sol在10次尝试中完成7次,每次预算1亿token,且性能随推理token增加而提升。

twitter关注列表2026-07-17#模型#技术突破#AI安全
观察