发生了什么
AutoLab 发布 AutoResearch 基准测试(36 个任务)
为什么值得关注
揭示了 Agent 成功关键在于持续测试与反馈迭代而非初始推理质量,值得深入研究其长时程任务的反馈机制。
信息来源
以下内容来自公开来源,可打开原文继续核验。
AutoLab: Can Frontier Models Solve Long-Ho
研究人员提出了 AutoLab 基准测试,包含 36 项涉及系统加速、谜题、模型开发及 CUDA kernel 工作的任务,旨在评估模型在长时程自动研究中的表现。通过对 17 个主流模型的测试发现,成功的关键不在于初始想法的质量,而在于模型的持续测试与反馈迭代能力;其中 Claude Opus 4.6 在该基准测试中表现最佳,原因在于其能有效利用实验反馈进行迭代,而非单纯依赖初始推理。
打开原始来源 ↗