发生了什么
Artificial Analysis 发布 AA-Briefcase 基准
为什么值得关注
该基准提供了长期知识工作任务的评估框架和成本-性能对比数据,值得关注方法设计和模型排名。
信息来源
以下内容来自公开来源,可打开原文继续核验。
Artificial Analysis 发布 AA-Briefcase 基准测试
Artificial Analysis 发布了新基准 AA-Briefcase,用于评估模型在长期知识工作项目上的表现。该基准包含四个私有场景和一个公开演示场景,测试模型在多周项目中的任务执行能力,涉及数千个输入文件。Claude Fable 5 以 Elo 1587 领先,成本每任务约 $31;Claude Opus 4.8 得 1356 分,成本 $10.40;GLM-5.2 得分 1266,成本 $2.40。所有模型在仅 3% 的任务中满足所有评分标准。
打开原始来源 ↗AA-Briefcase: 长期知识工作模型基准发布
Artificial Analysis 发布 AA-Briefcase 基准测试,评估模型在长期知识工作项目中的表现。Claude Fable 5 以 1587 Elo 领先,成本约 $31/任务;紧随其后的是 Claude Opus 4.8(1356 Elo, $10.40)和 GLM-5.2(1266 Elo, $2.40)。仅 3% 任务中顶级模型满足所有标准,表明现实复杂度仍是挑战。
打开原始来源 ↗