发生了什么
Jia Guo 发表 KPop(76+ SWE-bench Verified)
为什么值得关注
点开原文可重点看 KPop 的自适应 masking 机制、与 IcePop 的差异,以及纯 RL 达到 SWE-bench Verified 76+ 的训练设定是否可复现。
信息来源
以下内容来自公开来源,可打开原文继续核验。
KPop 提升 MoE RL 稳定性
团队提出 KPop,用自适应 binary-KL 区域替代 IcePop 里的固定比例 mask,以匹配每个 token 的噪声强度,从而提升大型 MoE 模型的 RL 训练稳定性和长时程 agentic RL 更新稳定性。该方法宣称无需修改基础设施、无需 routing replay,仅通过一个参数即可生效,并使 Ring-2.6-1T 在纯 RL 训练下在 SWE-bench Verified 上达到 76+。原帖同时回顾了去年发布的 IcePop:其通过双向 masking 稳定 MoE RL,但后续观察到 masking ratio 下降而训练-推理 mismatch 继续扩大。
打开原始来源 ↗