发生了什么
研究人员 发表 Copy Less, Ground More(提升准确率4.6点)
为什么值得关注
值得阅读原文,了解奖励机制的具体设计和实验细节,对改进长上下文推理有启发。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
Copy Less, Ground More: Overcoming Repetit
研究人员发现,即使在强推理模型中,长上下文下模型会无差别复制输入文本的惰性,导致准确率下降。他们提出一种基于证据感知的强化学习奖励机制,通过惩罚复制无关内容、奖励关注关键文本,将准确率提升最多4.6个百分点。
打开原始来源 ↗