发生了什么
Anthropic 发布 Claude Sonnet 5 (52.7% 回落, 63.2% 编码得分, 2 美元输入 10 美元输出)
为什么值得关注
与公开的 Opus 4.8 相比,Sonnet 5 在编码基准上虽低于但价格更具优势,建议关注其后续价格变动对 agentic AI 成本的影响。
信息来源
以下内容来自公开来源,可打开原文继续核验。
Claude Sonnet 5 System Card
Anthropic 发布 Claude Sonnet 5,其在 CyberGym 测试中表现回落至 52.7%,低于 Sonnet 4.6 的 65.2%,且在浏览器恶意软件利用测试中未产生完整 exploit,而 Mythos 5 达 88.4%。 MASK 说谎率最低 3.1%,其在 SWE‑bench Pro 编码基准上得分 63.2%,高于 Sonnet 4.6 的 58.1% 但低于 Opus 4.8 的 69.2%,价格为 2 美元输入、10 美元输出每百万 token(至 8 月 26 日),之后涨至 3 美元输入、15 美元输出,被称为最具 agentic 能力的 Sonnet 模型。
打开原始来源 ↗