发生了什么
NVIDIA 发表 优化器研究 (AdamW、SOAP、Muon 在 1 亿 token 批量下的对比)
为什么值得关注
该研究提供了 AdamW 在大批量下的缩放上限实证,并展示了 SOAP 和 Muon 的稳定训练方案,对大规模模型训练优化有直接参考价值。
信息来源
以下内容来自公开来源,可打开原文继续核验。
NVIDIA 研究:AdamW 在大批量训练中存在规模上限
NVIDIA 研究发现,AdamW 在批量大小达到 1 亿 token 时训练稳定性下降,而 SOAP 和 Muon 保持稳定。团队通过每步 QR 正交化和改进预处理策略消除了 SOAP 在大批量下的 loss spikes,并在多十亿参数模型上训练数万亿 token 后,SOAP 和 Muon 一致优于 AdamW。
打开原始来源 ↗