Signal Brief

Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价

Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 持平(输入 $5/M tokens,输出 $25/M tokens),性能接近 Fable 5 但成本仅为其半数,定位为高频可用的高端模型。基准测试显示其在 Frontier-Bench v0.1 编码任务中超越 Opu...

twitter关注列表 meng shao (@shao__meng) 发布 2026-07-25 收录 2026-07-25 值得跟进

一句话判断

首次披露同价位下接近 Fable 5 智能且推理 token 减少 6 倍的硬性数据,建议工程团队基于 CursorBench 与 OSWorld 实测评估迁移 ROI。

核心信息

Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 持平(输入 $5/M tokens,输出 $25/M tokens),性能接近 Fable 5 但成本仅为其半数,定位为高频可用的高端模型。基准测试显示其在 Frontier-Bench v0.1 编码任务中超越 Opus 4.8 超过一倍,ARC-AGI-3 得分为第二名三倍,OSWorld 2.0 计算机使用任务以三分之一成本超越 Fable 5,但在网络安全漏洞利用上仍落后于 Mythos 5。新增 Fast 模式(2.5 倍速度、2 倍价格)、API 自动降级功能,并在自主造工具、根因分析、自我验证、长程一致性等代理行为上显著增强。

原始内容

Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价 Anthropic 自己也强调:它的目标是 “designed to be used every day”,成为 Claude Max 的默认模型、Claude Pro 的最强模型。 Anthropic 把 Opus 5 放在“高端但可高频调用”的区间,而不是像 Fable 5 那样作为更昂贵、更实验性的顶级模型。它要和 Opus 4.8 保持同价(input $5/M tokens,output $25/M tokens),即性能大幅提升、价格不动。 性能:很强,但要看细分维度 · 软件工程 / 编码:Frontier-Bench v0.1 新 SOTA,比 Opus 4.8 提升超过一倍,成本比 Opus 4.8 低; · 通用知识工作:GDPval-AA、Frontier-Bench 等 SOTA · 新颖问题解决:ARC-AGI-3 得分是“第二名”的 3 倍 · 计算机使用:OSWorld 2.0 在同等成本下超过所有模型,仅三分之一成本就超过 Fable 5 · 网络安全(发现漏洞):接近 Mythos 5 · 网络安全(利用漏洞 / 写 exploit):仍明显落后于 Mythos 5 效率与定价策略 Anthropic 反复强调 “cost per task” 而非 “cost per token”。这其实是把竞争拉回到“完成同一件事要花多少钱”的维度。 几个关键数据: · CursorBench 3.2:最大 effort 下接近 Fable 5 峰值,成本仅一半。 · OSWorld 2.0:超过 Fable 5 最佳成绩,成本仅三分之一多一点。 · 某金融建模场景:平均准确率提高 9 个百分点,turns/tool calls 减少三分之一,时间减少 60%。 · 某交易场景:推理 token 大约只有 Opus 4.8 的七分之一,延迟不到一半。 这暗示 Opus 5 在推理效率上有明显优化,而不是靠堆更多算力。对于企业用户,这直接关系到成本。 还有两点商业更新: · Fast mode:2.5 倍速度,2 倍价格。 · API 自动 fallback:安全分类器拦截的 Opus 5 / Fable 5 请求可以自动降级到其它模型,避免直接失败。 行为与“能动性”:更主动、更会自我纠错 1. 自主找路:没有现成工具时,会自己造工具(例如自己写 CV pipeline 从像素提取几何信息)。 2. 根因分析:不是修表面症状,而是找到底层 bug(开源包管理器案例)。 3. 自我验证:像前端开发者一样在桌面/移动端打开页面检查、修复隐藏元素。 4. 敢于质疑:用户提出的设计有问题时,会解释并给出折中方案。 5. 长程一致性:在金融、基因组、法律等长流程任务中,偏差更小。 ![photo](https://pbs.twimg.com/media/HOCgHCda4AAVNah.jpg) > **引用原帖 Claude (@claudeai):** > Introducing Claude Opus 5. > It's a thoughtful and proactive model that comes close to the frontier intelligence of Fable 5 at half the price. https://t.co/GQWhcq2CQL > https://x.com/claudeai/status/2080699495453528290

相关动态

03

Meta 发布 Llama 3 8B

Meta 发布 Llama 3 8B 与 70B 两款模型,参数量分别为 8B 和 70B。 在 MMLU 基准上,8B 版本比 Llama 2 提升 5%,70B 版本提升 3%。

twitter关注列表2026-07-24#模型发布#技术
观察