Signal Brief

Anthropic 发布 Claude Opus 5,性能接近 Fable 5 价格仅一半

Anthropic 发布 Claude Opus 5,API 输入/输出价格分别为 5/25 美元每百万 Token,与 Opus 4.8 相同,但性能接近定价两倍的 Fable 5。在 Frontier-Bench 上得分翻倍,CursorBench 最高 Effort 与 Fable 5 差距不...

twitter关注列表 宝玉 (@dotey) 发布 2026-07-24 收录 2026-07-24 值得跟进

一句话判断

新增了 Opus 5 与前代及 Fable 5 的详细性能对比数据,以及安全拦截下降 85% 等反共识细节。

核心信息

Anthropic 发布 Claude Opus 5,API 输入/输出价格分别为 5/25 美元每百万 Token,与 Opus 4.8 相同,但性能接近定价两倍的 Fable 5。在 Frontier-Bench 上得分翻倍,CursorBench 最高 Effort 与 Fable 5 差距不到 0.5%,ARC-AGI 3 得分是第二名三倍。安全对齐失准得分 2.3,网络漏洞发现接近 Mythos 5,拦截频率比 Fable 5 低 85%。Claude Max 默认切换为该模型,API 已开放。

原始内容

猜猜今天哪家会重置额度? 我估计 Codex 和 Claude Code 都会重置 > **引用原帖 宝玉 (@dotey):** > Anthropic 今天发布了 Claude Opus 5。API 价格为每百万输入 Token 5 美元、输出 Token 25 美元,与上一代 Opus 4.8 完全相同,但只有 Fable 5 的一半。官方给出的定位是:以一半的价格,提供接近 Fable 5 的前沿智能。 > Fable 5 是 Anthropic 于 6 月 9 日发布的最强公开模型,输入、输出价格分别为每百万 Token 10 美元和 50 美元,是史上最昂贵的通用模型。同一底座的 Mythos 5 则只向 Project Glasswing 的少数合作伙伴开放。 > 【1】性能 > 在 Frontier-Bench v0.1 上,Opus 5 的成绩是 Opus 4.8 的两倍多,单任务成本反而更低。在 CursorBench 3.2 上,使用最高 Effort 档时,它与 Fable 5 峰值成绩的差距不到 0.5%,每项任务的成本却只有后者的一半。 > 【注:Effort 是可调节的思考强度档位。档位越高,模型思考得越多,价格也越高。】 > ARC-AGI 3 测试的是模型解决未见过的新题的能力,Opus 5 的得分达到第二名模型的三倍。Zapier AutomationBench 测试的是模型能否将一项业务从头到尾完整执行;在成本相同的情况下,Opus 5 的任务通过率约为第二名的 1.5 倍。即使使用最低 Effort 档,它完成的任务也比其他所有模型更多。在电脑操作评测 OSWorld 2.0 上,它仅用 Fable 5 三分之一出头的成本,就超过了后者的最佳成绩。 > 在有机化学任务上,Opus 5 比 Opus 4.8 高出 10.2 个百分点;在蛋白质相关任务上,则高出 7.7 个百分点。 > 【2】几个比分数更能说明问题的例子 > 有一道题给了 Opus 5 一张机械零件图纸,要求它编写代码,在 FreeCAD 中重建三维模型,但故意不让模型直接“看”图。Opus 5 自己编写了一套计算机视觉流程,从原始像素中提取几何形状,再还原出整个零件,而且能够反复成功。同样配置下,其他模型尝试五次都没能完成。 > 在一个开源包管理器的真实 Bug 中,社区补丁遗漏了一个边界情况。Opus 5 找到了根因,并补上了这个缺口;对照模型则只修复了表面症状,随后便宣布 Bug 已解决。 > 一位交易公司的工程师使用 Opus 5,在一个会话中完成了新交易所的行情数据接入。由于找不到实时数据进行验证,Opus 5 便自行搭建了一套测试框架,用来检查解析结果是否正确。 > 【3】谁现在就能用 > Claude Max 的默认模型已经切换为 Opus 5,Pro 用户目前能够使用的最强模型也是它。开发者可以通过 `claude-opus-5` 调用 API。Fast 模式的速度约为普通模式的 2.5 倍,价格则翻倍。 > 此次上线的两个 Beta 功能,对开发 Agent 的人很有实际价值。 > 一是对话进行到一半时,即使更换工具,也不会导致 Prompt 缓存失效。过去只要修改一次工具列表,整段缓存就会作废,成本随即上升。 > 二是 API 可以启用自动降级功能。被安全分类器拦截的请求会自动转交给其他模型处理,而不是直接失败。 > 【4】安全与拦截 > Anthropic 表示,Opus 5 是其迄今为止对齐程度最高的模型。在自动化行为审计中,它的综合失准得分为 2.3,低于 Opus 4.8、Sonnet 5 和 Fable 5,欺骗行为所占比例也是最低的。 > 网络安全部分有一个值得注意的细节:Anthropic 刻意没有使用网络攻防任务训练 Opus 5,但随着通用能力提升,它发现漏洞的水平已经接近 Mythos 5。不过,在将漏洞转化为可用攻击代码方面,两者仍有很大差距。 > 安全分类器允许 Opus 5 在源代码中寻找漏洞,但会拦截二进制层面的漏洞扫描、渗透测试和 Exploit 生成。它的拦截频率比 Fable 5 低约 85%。在 https://t.co/aTfkxmbzQe、Claude Code 和 Cowork 中,被拦截的请求默认会回退至 Opus 4.8。 > 生物领域的限制则有所放宽:原本在 Fable 5 上被拦截的生物类请求,现在会转交给 Opus 5,而不是此前的 Opus 4.8。Anthropic 称,Opus 5 是目前面向科研场景能力最强的公开模型,但它在长时间自主研究任务上仍存在明显限制。 > https://x.com/dotey/status/2080701514402730046

相关动态

03

Introducing Claude Opus 5.

Claude 发布 Opus 5,声称接近 Fable 5 的前沿智能且价格仅为一半。Opus 5 在网络安全任务上强于 Opus 4.8,但远落后于 Mythos 5。该模型发布于所有付费计划和 API,定价与 Opus 4.8 相同,并提供 2.5 倍速度的 Fast 模式。

twitter关注列表2026-07-24#AI#模型发布#产品发布
值得跟进
04

Anthropic 发布 Claude Opus 5

Anthropic 发布 Claude Opus 5,API 价格为每百万输入 Token 5 美元、输出 25 美元,与 Opus 4.8 相同,是 Fable 5 的一半。在 Frontier-Bench v0.1 上成绩是 Opus 4.8 的两倍多,CursorBench 3.2 上最高 Effort 与 Fable 5 差距不到...

twitter关注列表2026-07-24#模型发布#AI#大模型
值得跟进