英伟达研究:AdamW存在规模天花板,SOAP/Muon训练更稳

📡 Elvis Saravia2026-07-27 04:09

英伟达研究称AdamW在超大批量训练下不稳定,SOAP与Muon经每步正交化改进后更稳且持续领先。

AI 深度解读

英伟达一项新研究给沿用多年的AdamW优化器判了「规模天花板」——当批大小冲到1亿token量级时,AdamW的训练稳定性明显下降,而SOAP和Muon这两种替代优化器却能扛住,这对不断把批量堆大的大模型训练是个实打实的预警。

  • 核心发现:在高达1亿token的批大小下,AdamW的训练稳定性开始下降,不再是「加大参数量、加大批量」时代默认安全的选择
  • SOAP此前在大批量下也会出现损失尖峰,团队通过在每一步做QR正交化解决了这个问题,让SOAP变得真正可用
  • 验证规模不小:团队在数万亿token、数十亿参数级别的真实训练中,持续观察到SOAP和Muon优于AdamW,不是小规模实验室结论
  • 配套给出与Megatron-LM兼容的逐层分布式优化器实现,在内存和通信开销之间做了平衡,不牺牲收敛收益,说明这套结论具备工程落地条件
  • 研究出自英伟达之手,大概率会反哺其自身大模型训练栈和后续开源工具链
  • 如果你在做大批量预训练或调优化器选型,这项研究给出了一个可执行的信号:别把AdamW当默认项,SOAP/Muon配合合适的分布式实现可能是更稳的路线。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com