← 返回精选动态
精选动态

Understanding Reasoning from Pretraining t

论文 发表 预训练与后训练推理关系

更新于 2026年07月26日 23:41 1 条公开来源

发生了什么

论文 发表 预训练与后训练推理关系

为什么值得关注

论文通过象棋实验量化了预训练与RL收益的关系,并发现RL会放大错误模式这一反直觉现象。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Understanding Reasoning from Pretraining t

twitter关注列表 2026年07月26日 22:28

论文通过象棋实验(5M-1B参数模型,36种预训练-RL组合)发现:预训练验证损失能高精度预测后RL的pass@1(相关性从0.93到0.99),RL计算量每10倍增益与预训练token数对数正相关(r=+0.84);RL最优计算量份额在50M参数时为20%,680M时为28%,且RL会放大模型在困难问题上的错误模式。

打开原始来源 ↗
← 返回精选动态