← 返回精选动态
精选动态

Artificial Analysis 发布了 AI 编码代理基准评测

Artificial Analysis 发布了 AI 编码代理基准评测,基于 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA 三个基准,对多个模型和 Harness 的代码代理性能、成本和时间进行对比分析。

更新于 2026年05月12日 00:19 1 条公开来源

发生了什么

Artificial Analysis 发布了 AI 编码代理基准评测,基于 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA 三个基准,对多个模型和 Harness 的代码代理性能、成本和时间进行对比分析。

为什么值得关注

为开发者提供了横向对比编码代理实际工程能力的系统性基准,包含成本、耗时和通过率等关键指标,有参考价值。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Artificial Analysis 发布了 AI 编码代理基准评测

twitter关注列表 2026年05月11日 23:49

Artificial Analysis 发布了 AI 编码代理基准评测,基于 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA 三个基准,对多个模型和 Harness 的代码代理性能、成本和时间进行对比分析。

打开原始来源 ↗
← 返回精选动态