发生了什么
Anthropic 开源 Opus 5(相较Fable 5优势存异常记录)
为什么值得关注
需关注基准测试方法论修正及训练策略调整可能性,同时留意人性化交互优化方向
信息来源
以下内容来自公开来源,可打开原文继续核验。
Anthropic Opus 5 表现与基准值失衡、指令优先级争议
用户分析发现,Anthropic Opus 5 在基准测试中表现超出 Fable 5 并引发基准值有效性质疑。根据 Kun Chen 的观察,尽管 Opus 5 在多项指标上胜过 Fable 5,但实际应用场景中两者效能差异显著。研究指出公司在 5 系列模型训练策略上发生变化,将 Mythos 作为先导模型后通过蒸馏生成 Sonnet 和 Opus,但此策略可能导致生成效能未达预期。同时指出人性化交互体验下降,用户更偏好 Grok 和 Kimi 的使用体验。
打开原始来源 ↗