← 返回精选动态
精选动态

Artificial Analysis 发布 AA-Briefcase 基准测试

Artificial Analysis 发布 AA-Briefcase 基准

更新于 2026年06月19日 08:46 2 条公开来源

发生了什么

Artificial Analysis 发布 AA-Briefcase 基准

为什么值得关注

该基准提供了长期知识工作任务的评估框架和成本-性能对比数据,值得关注方法设计和模型排名。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Artificial Analysis 发布 AA-Briefcase 基准测试

twitter关注列表 2026年06月19日 07:51

Artificial Analysis 发布了新基准 AA-Briefcase,用于评估模型在长期知识工作项目上的表现。该基准包含四个私有场景和一个公开演示场景,测试模型在多周项目中的任务执行能力,涉及数千个输入文件。Claude Fable 5 以 Elo 1587 领先,成本每任务约 $31;Claude Opus 4.8 得 1356 分,成本 $10.40;GLM-5.2 得分 1266,成本 $2.40。所有模型在仅 3% 的任务中满足所有评分标准。

打开原始来源 ↗
02

AA-Briefcase: 长期知识工作模型基准发布

twitter关注列表 2026年06月19日 07:01

Artificial Analysis 发布 AA-Briefcase 基准测试,评估模型在长期知识工作项目中的表现。Claude Fable 5 以 1587 Elo 领先,成本约 $31/任务;紧随其后的是 Claude Opus 4.8(1356 Elo, $10.40)和 GLM-5.2(1266 Elo, $2.40)。仅 3% 任务中顶级模型满足所有标准,表明现实复杂度仍是挑战。

打开原始来源 ↗
← 返回精选动态