发生了什么
Artificial Analysis 公布 AA-Briefcase 基准测试
为什么值得关注
该基准测试提供了具体成本与性能数据,值得原文查看详细模型排行和成本效率分析。
信息来源
以下内容来自公开来源,可打开原文继续核验。
Artificial Analysis 发布 AA-Briefcase 基准测试
Artificial Analysis 发布 AA-Briefcase 代理知识工作基准测试,测试模型在长期任务中构建金融模型、董事会演示等可交付成果的能力。最高性能模型 Claude Fable 5 单次任务成本超 $20,成本效率为模型选择关键。在成本-性能帕累托前沿中,开源模型占多数:GLM 5.2 (max) 以 $2.40/次成本达 Claude Opus 4.8 的 90 Elo 分内(成本低 65%);DeepSeek V4 Pro (max) 以 $0.08/次成本比 Gemini 3.5 Flash 高约 60 Elo 分(成本低 98%)。
打开原始来源 ↗