NanoGPT 训练纪录刷新至 39.9 秒:核心优化策略与技术复盘
开发者 Deven Pzak 通过精细化算力收益取舍与稀疏嵌入等优化,将 NanoGPT 训练耗时大幅缩短至 39.9 秒。
AI 深度解读
开发者 Deven Pzak 在开源项目 modded-nanogpt 中将 NanoGPT 训练时间缩短至 39.9 秒,展示了从计算吞吐向浮点运算价值优化的系统级调优路径。
- 优化核心思路从单一矩阵乘法优化转向单个 FLOP 收益取舍,针对各计算环节进行重构。
- 关键改进包括引入采样 softmax 节省约 8 秒、设计 64 维 head 的手写 Flash Attention,以及在最后 300 步启用 EMA 与新型优化器 Anvil2 带来约 1 秒加速。
- 将 ngram 嵌入的稀疏参数扩展至 65B 并配合稀疏更新与优化器状态分片通信,单项贡献了该合并请求约 25% 的性能增益。
- 影响/看点:这一工程实践证明在极度受限的小模型训练基准中,算法层面的稀疏化与针对性算子定制仍有显著压缩空间,但超大稀疏嵌入等特定技巧向通用大模型预训练迁移时,其显存利用与收敛稳定性仍需在更大规模下验证。
- 资料依据:
- GitHub:KellerJordan/modded-nanogpt(2026-09-29):https://github.com/KellerJordan/modded-nanogpt/pull/360
- Hyperstition 技术复盘(2026-09-29):https://hyperstition.cc/training-nanogpt-in-39-9-seconds
- X:Thomas Wolf(2026-09-29):https://x.com/Thom_Wolf/status/2104810074694656091
本内容由 AI 生成,仅供参考,请注意甄别