发生了什么
论文 发表 预训练与后训练推理关系
为什么值得关注
论文通过象棋实验量化了预训练与RL收益的关系,并发现RL会放大错误模式这一反直觉现象。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
Understanding Reasoning from Pretraining t
论文通过象棋实验(5M-1B参数模型,36种预训练-RL组合)发现:预训练验证损失能高精度预测后RL的pass@1(相关性从0.93到0.99),RL计算量每10倍增益与预训练token数对数正相关(r=+0.84);RL最优计算量份额在50M参数时为20%,680M时为28%,且RL会放大模型在困难问题上的错误模式。
打开原始来源 ↗