← 返回精选动态
精选动态

FrontierCode 编码基准正式发布

METR_Evals 发布 FrontierCode(3000+ 评分标准)

更新于 2026年06月10日 01:40 1 条公开来源

发生了什么

METR_Evals 发布 FrontierCode(3000+ 评分标准)

为什么值得关注

建议阅读原文深入了解 AI 编码三大时代演变和 FC 各难度层级的模型表现,为理解当前 Agentic 编程发展趋势提供重要参考。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

FrontierCode 编码基准正式发布

twitter关注列表 2026年06月10日 01:17

METR_Evals 发布 FrontierCode 基准,用于评测 AI 编程能力,包含 3000+ 评分标准和 1000+ 小时维护人员验证的软件工程任务。Opus 4.8 在 FC Diamond 上得分为 13.8%,GPT 5.5 和 Opus 4.8 均未显著提升。相比 HumanEval 和 SWEBench,FrontierCode 聚焦可维护代码质量。历史数据显示 Opus 模型在 2025 年底 4 个月内从 41% 提升至 74%,反映 AI 编码能力快速进步。

打开原始来源 ↗
← 返回精选动态