英伟达研究:AdamW存在规模天花板,SOAP/Muon训练更稳
英伟达研究称AdamW在超大批量训练下不稳定,SOAP与Muon经每步正交化改进后更稳且持续领先。
AI 深度解读
英伟达一项新研究给沿用多年的AdamW优化器判了「规模天花板」——当批大小冲到1亿token量级时,AdamW的训练稳定性明显下降,而SOAP和Muon这两种替代优化器却能扛住,这对不断把批量堆大的大模型训练是个实打实的预警。
- 核心发现:在高达1亿token的批大小下,AdamW的训练稳定性开始下降,不再是「加大参数量、加大批量」时代默认安全的选择
- SOAP此前在大批量下也会出现损失尖峰,团队通过在每一步做QR正交化解决了这个问题,让SOAP变得真正可用
- 验证规模不小:团队在数万亿token、数十亿参数级别的真实训练中,持续观察到SOAP和Muon优于AdamW,不是小规模实验室结论
- 配套给出与Megatron-LM兼容的逐层分布式优化器实现,在内存和通信开销之间做了平衡,不牺牲收敛收益,说明这套结论具备工程落地条件
- 研究出自英伟达之手,大概率会反哺其自身大模型训练栈和后续开源工具链
- 如果你在做大批量预训练或调优化器选型,这项研究给出了一个可执行的信号:别把AdamW当默认项,SOAP/Muon配合合适的分布式实现可能是更稳的路线。
本内容由 AI 生成,仅供参考,请注意甄别