一句话判断
值得阅读原文,了解奖励机制的具体设计和实验细节,对改进长上下文推理有启发。
核心信息
研究人员发现,即使在强推理模型中,长上下文下模型会无差别复制输入文本的惰性,导致准确率下降。他们提出一种基于证据感知的强化学习奖励机制,通过惩罚复制无关内容、奖励关注关键文本,将准确率提升最多4.6个百分点。
原始内容
相关动态
OpenAI Code模型升级及Cerebras GPT-5.6 Sol速度突破
OpenAI_upgrade Codex功能(增加实时语音支持与并行工作代理),Cerebras_GP5.6 Sol推动性能至750 tok/s。多中流程升级凸显大模型交互速度优化方向。
RedNote AI 模型获 IMO 满分 42/42
RedNote(小红书母公司)旗下 AI 模型 dots-note-3.0 在国际数学奥林匹克竞赛(IMO)中获得 42/42 满分,成为首个达成此成就的 AI 系统。该模型直接阅读原始竞赛文档,通过结合自然语言推理与 Python 代码执行的代理循环,经草稿测试、破坏、修复及自我审查后提交答案,全程无人工改写或提示。对比之下,Googl...
RedNote AI模型IMO满分42分
RedNote(小红书)的AI模型dots-note-3.0在国际数学奥林匹克竞赛中获得满分42分,而Google DeepMind和OpenAI去年仅得35分。该模型直接阅读原题,使用自然语言推理与自执行Python代码的智能体循环,并具备自我审查机制,最终在禁止外部帮助的条件下取得满分。模型为dots3系列最小版本,承诺未来开源。
Grok 4.5 反驳30年图论猜想
Grok 4.5 通过 Capy 在 8 分钟内反驳了开放约 30 年的 Graffiti Conjecture 284,该猜想此前未被解决。
PaddlePaddle开源HPD-Parsing文档解析器
PaddlePaddle在ModelScope上开源发布1B参数文档解析器HPD-Parsing(Apache 2.0),采用层级并行解码替代逐页序列生成,在OmniDocBench v1.6上得分94.91%报告为端到端统一解析器SOTA,吞吐达4752 TPS,较最快对比解析器高1.62倍、较自回归基线高3.06倍,长文档延迟降低5....