← 返回精选动态
精选动态

NVIDIA 研究:AdamW 在大批量训练中存在规模上限

NVIDIA 发表 优化器研究 (AdamW、SOAP、Muon 在 1 亿 token 批量下的对比)

更新于 2026年07月27日 04:43 1 条公开来源

发生了什么

NVIDIA 发表 优化器研究 (AdamW、SOAP、Muon 在 1 亿 token 批量下的对比)

为什么值得关注

该研究提供了 AdamW 在大批量下的缩放上限实证,并展示了 SOAP 和 Muon 的稳定训练方案,对大规模模型训练优化有直接参考价值。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

NVIDIA 研究:AdamW 在大批量训练中存在规模上限

twitter关注列表 2026年07月27日 04:09

NVIDIA 研究发现,AdamW 在批量大小达到 1 亿 token 时训练稳定性下降,而 SOAP 和 Muon 保持稳定。团队通过每步 QR 正交化和改进预处理策略消除了 SOAP 在大批量下的 loss spikes,并在多十亿参数模型上训练数万亿 token 后,SOAP 和 Muon 一致优于 AdamW。

打开原始来源 ↗
← 返回精选动态