发生了什么
Artificial Analysis 公布 AA-Briefcase 基准测试结果(平均每任务时间对比)
为什么值得关注
提供了各模型在长时间知识任务上的具体耗时数据,值得关注 GPT-5.5 的高效性和 GLM-5.2 的开源表现。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
AA-Briefcase 基准测试揭示模型耗时
Artificial Analysis 发布 AA-Briefcase 基准测试,测量模型在长时间知识任务中的平均耗时。Claude Opus 4.8 平均每任务约 23 分钟,GPT-5.5 (xhigh) 约 11 分钟,GLM-5.2 约 16.3 分钟。Claude Fable 5 若可用预计约 28.5 分钟,工具调用仅占 12% 时间。
打开原始来源 ↗