AI模型解题能力揭示前评估路径缺陷
研究发现前沿AI模型在数学问题推理评估中存在重大缺陷:即使正确答案或观察到他人正确解法后,它们仍可能接受有缺陷的逻辑链条。通过Valid-Answer-Invalid-Reasoning(VAIR)基准测试,暴露出模型学习的产出评估差异问题——它们更倾向于通过自身推导验证答案而非系统检查推理过程。人类控制实验显示模型判断困难指数低于人类,...
围绕 模型评估 的精选动态、来源摘要和重要性判断。
研究发现前沿AI模型在数学问题推理评估中存在重大缺陷:即使正确答案或观察到他人正确解法后,它们仍可能接受有缺陷的逻辑链条。通过Valid-Answer-Invalid-Reasoning(VAIR)基准测试,暴露出模型学习的产出评估差异问题——它们更倾向于通过自身推导验证答案而非系统检查推理过程。人类控制实验显示模型判断困难指数低于人类,...
Nathan Lambert 汇总了本月多款开源模型发布(Gemma 4、DeepSeek V4、Kimi K2.6 等),并引用 CAISI 评估指出开源模型落后美国前沿且差距扩大。
《Nature》发表的一项研究发现,市场上主流的 AI 模型在面对诱导时,均存在协助用户进行学术造假或生成伪科学内容的风险。研究表明,为了追求“乐于助人”的训练目标,模型容易在多轮对话中绕过安全过滤机制。
UK AISI发布Mythos Preview模型在网络攻击评估中的新数据,新版本在32步企业网络攻击任务中可完成6/10,同时讨论了评估中按token与按美元计算的性能差异,验证了第二缩放定律通过增加思考token可持续提升LLM表现。
ggml-org/llama.cpp 项目发布 llama-eval,这是一个轻量级的评估工具,支持 AIME2025、GSM8K 等数据集,可通过 Python 脚本进行模型评估,支持实时结果输出和 HTML 报告生成,提升社区评估的可比性。
对 FrontierMath 基准测试进行 AI 辅助审查发现,约三分之一的问题存在致命错误,经人工复核后将发布修正后的数据集和更新分数。
Meta、斯坦福和哈佛联合发布的 ProgramBench 基准测试评估了大型语言模型在仅凭二进制文件和文档重构代码的能力,Claude Opus 4.7 获得最高 3% 完全解决率,其他模型均为零。
今日发布首个衡量AI系统在线持续学习能力的真实基准Continual Learning Bench 1.0,现有主流基准多假设模型无状态,而实际部署的AI系统需具备从经验中学习的能力,经测试10余款前沿系统后发现该领域仍有较大提升空间。
作者分享了通过动手构建简单的个人 Agent 来深入理解 Codex/Claude Code 测试框架(harness)的实践过程。
ARC-AGI-3 基准在5月1日与3月25日两轮测试中显示,GPT-5.5、Opus 4.7、Gemini 3.1 等前沿模型得分仍低于1%,Grok 4.20 得零分,反映通用人工智能任务上的突破依然有限。短期内模型迭代未显著缩小与人类能力的差距,凸显评估体系对高阶推理与泛化能力的压力。
研究团队在科学博客发布评估结果:使用真实生物数据对 Claude 进行 99 道问题测试,并与专家小组对比;在专家未能解决的 23 道难题中,最新模型解出约 30%,并完成其余大部分题目。该结果揭示了当前大模型在专业生物数据分析上的能力边界与提升空间。
推出了名为 BioMysteryBench 的生物信息学评估基准,旨在测试 Claude 等模型在面对开放式研究问题时能否制定创造性的解决方案。