发生了什么
对 FrontierMath 基准测试进行 AI 辅助审查发现,约三分之一的问题存在致命错误,经人工复核后将发布修正后的数据集和更新分数。
为什么值得关注
FrontierMath 是 AI 数学推理领域的重要评测基准,发现 33% 问题存在错误将对模型评估和开发产生重大影响。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
对 FrontierMath 基准测试进行 AI 辅助审查发现
对 FrontierMath 基准测试进行 AI 辅助审查发现,约三分之一的问题存在致命错误,经人工复核后将发布修正后的数据集和更新分数。
打开原始来源 ↗02