← 返回精选动态
精选动态

Artificial Analysis发布了Coding Agent Index

Artificial Analysis发布了Coding Agent Index,综合测评了150余个模型与Harness(如Cursor CLI、Claude Code等)的组合性能,涉及SWE-Bench-Pro-Hard-AA、Terminal-Bench v2和SWE-Atlas-QnA等三...

更新于 2026年05月12日 07:04 1 条公开来源

发生了什么

Artificial Analysis发布了Coding Agent Index,综合测评了150余个模型与Harness(如Cursor CLI、Claude Code等)的组合性能,涉及SWE-Bench-Pro-Hard-AA、Terminal-Bench v2和SWE-Atlas-QnA等三个真实编码基准;Opus 4.7在Cursor CLI上获61分领先,GPT-5.5和Claude Code组合亦得60分,开源模型GLM-5.1在Claude Code上获53分,是开源最高分;成本差异30倍、耗时差异7倍,Gemini 3.1 Pro在自家CLI上仅43分。

为什么值得关注

提供了开发者选择Coding Agent的关键数据维度(性能、成本、效率),且涉及行业主流模型与Harness组合,值得开发者参考。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Artificial Analysis发布了Coding Agent Index

twitter关注列表 2026年05月12日 06:57

Artificial Analysis发布了Coding Agent Index,综合测评了150余个模型与Harness(如Cursor CLI、Claude Code等)的组合性能,涉及SWE-Bench-Pro-Hard-AA、Terminal-Bench v2和SWE-Atlas-QnA等三个真实编码基准;Opus 4.7在Cursor CLI上获61分领先,GPT-5.5和Claude Code组合亦得60分,开源模型GLM-5.1在Claude Code上获53分,是开源最高分;成本差异30倍、耗时差异7倍,Gemini 3.1 Pro在自家CLI上仅43分。

打开原始来源 ↗
← 返回精选动态