← 返回精选动态
精选动态

Copy Less, Ground More: Overcoming Repetit

研究人员 发表 Copy Less, Ground More(提升准确率4.6点)

更新于 2026年07月23日 14:48 1 条公开来源

发生了什么

研究人员 发表 Copy Less, Ground More(提升准确率4.6点)

为什么值得关注

值得阅读原文,了解奖励机制的具体设计和实验细节,对改进长上下文推理有启发。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Copy Less, Ground More: Overcoming Repetit

twitter关注列表 2026年07月23日 13:52

研究人员发现,即使在强推理模型中,长上下文下模型会无差别复制输入文本的惰性,导致准确率下降。他们提出一种基于证据感知的强化学习奖励机制,通过惩罚复制无关内容、奖励关注关键文本,将准确率提升最多4.6个百分点。

打开原始来源 ↗
← 返回精选动态