← 返回精选动态
精选动态

Meta、斯坦福和哈佛联合发布的 ProgramBench 基准测试评估了大型语言模

Meta、斯坦福和哈佛联合发布的 ProgramBench 基准测试评估了大型语言模型在仅凭二进制文件和文档重构代码的能力,Claude Opus 4.7 获得最高 3% 完全解决率,其他模型均为零。

更新于 2026年05月11日 13:22 1 条公开来源

发生了什么

Meta、斯坦福和哈佛联合发布的 ProgramBench 基准测试评估了大型语言模型在仅凭二进制文件和文档重构代码的能力,Claude Opus 4.7 获得最高 3% 完全解决率,其他模型均为零。

为什么值得关注

首次量化 AI 编码能力的极限,对模型研发和行业竞争具有重要参考价值。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Meta、斯坦福和哈佛联合发布的 ProgramBench 基准测试评估了大型语言模

twitter关注列表 2026年05月11日 12:52

Meta、斯坦福和哈佛联合发布的 ProgramBench 基准测试评估了大型语言模型在仅凭二进制文件和文档重构代码的能力,Claude Opus 4.7 获得最高 3% 完全解决率,其他模型均为零。

打开原始来源 ↗
← 返回精选动态