一句话判断
差异点:Opus 5在ARC-AGI 3上从<5%跃升至>30%,且比Fable 5成本低26%,体现了模型快速迭代。
核心信息
在发布仅两个月内,Opus 5模型在ARC-AGI 3基准上从Opus 4.8的低于5%提升至超过30%,并在Artificial Analysis基准上以比Fable 5低26%的成本提供相当智能。
原始内容
相关动态
Atomic Agent GAIA基准胜Hermes
Atomic Agent在GAIA Level 1基准测试中以69.8%正确率超越Hermes的58.5%,速度快1.6倍(3h12m vs 5h10m),使用相同4-bit Qwen-3.6-35B模型和Apple M4 Max硬件,开源MIT许可。
Claude Opus 5 在 3D 编码测试中超越 Fable 5,价格仅为其三分之四
Anthropic 发布了 Claude Opus 5,官方称其为 '思慎且主动的模型',性能接近 Claude Fable 5 但价格仅为后者一半。Opus 5 在 frontier-bench v0.1(43.3%)、gdpval-aa v2(1861)、arc-agi-3(30.2%)、zapier automationbench(...
OPUS 5超越Fable 5
Chubby♨️发布OPUS 5模型对比,声称在大多数评估中超越Fable 5。核心数据为评估结果比较,但未具体披露参数量、版本号或具体分数
Claude Opus 5登顶ARC-AGI-3
ARC Prize 公布 Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准上达到 30.2% 的新 SOTA,远超前最高分 7.8%(由 GPT-5.6 Sol (Max) 创造),并展现出解决之前未击败环境的新颖行为。
Opus 5 发布:价格减半性能领先
Anthropic 发布 Claude Opus 5,定价 $5/$25 每百万 token(与 Opus 4.8 相同),仅为 Fable 5 的一半,但在绝大多数基准测试中击败了 Fable 5。它支持五种努力设置,默认启用推理,并在编码、操作计算机等经济价值高的任务上表现更强,具有自主验证和恢复能力。