一句话判断
首个在 IMO 正式赛制下获满分的 AI,其无人工改写原始文档、代理循环自我修复的方法论区别于传统仅验证最终答案的基准,值得阅读原文了解技术细节并跟踪开源进展。
核心信息
RedNote(小红书母公司)旗下 AI 模型 dots-note-3.0 在国际数学奥林匹克竞赛(IMO)中获得 42/42 满分,成为首个达成此成就的 AI 系统。该模型直接阅读原始竞赛文档,通过结合自然语言推理与 Python 代码执行的代理循环,经草稿测试、破坏、修复及自我审查后提交答案,全程无人工改写或提示。对比之下,Google DeepMind 和 OpenAI 去年最佳成绩为 35/42,本届上海 666 名人类参赛者仅 7 人满分。RedNote 承诺后续开源该模型,获胜变体为 dots3 系列中最小版本,另有 jazz 和 aria 两个更大版本。
原始内容
相关动态
GPT-5.6 Sol解决6个Erdős问题
一位研究员使用GPT-5.6 Sol在5天内解决了6个开放Erdős问题(尝试13个,成功率46%)。他采用合同式提示,明确证明要求、排除弱结果,并指定搜索策略,包括同时探索多种路径和对抗性检查。
OpenAI Code模型升级及Cerebras GPT-5.6 Sol速度突破
OpenAI_upgrade Codex功能(增加实时语音支持与并行工作代理),Cerebras_GP5.6 Sol推动性能至750 tok/s。多中流程升级凸显大模型交互速度优化方向。
RedNote AI模型IMO满分42分
RedNote(小红书)的AI模型dots-note-3.0在国际数学奥林匹克竞赛中获得满分42分,而Google DeepMind和OpenAI去年仅得35分。该模型直接阅读原题,使用自然语言推理与自执行Python代码的智能体循环,并具备自我审查机制,最终在禁止外部帮助的条件下取得满分。模型为dots3系列最小版本,承诺未来开源。
Grok 4.5 反驳30年图论猜想
Grok 4.5 通过 Capy 在 8 分钟内反驳了开放约 30 年的 Graffiti Conjecture 284,该猜想此前未被解决。
Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning
研究人员发现,即使在强推理模型中,长上下文下模型会无差别复制输入文本的惰性,导致准确率下降。他们提出一种基于证据感知的强化学习奖励机制,通过惩罚复制无关内容、奖励关注关键文本,将准确率提升最多4.6个百分点。