SLAI T-Rex:在昇腾 SuperPOD 上对 DeepSeek-V4 系列进行全参数后训练

📡 HuggingFace Daily Papers2026-07-22 08:00

在昇腾NPU SuperPOD上对万亿参数MoE模型DeepSeek-V4进行全参数后训练,实现34.22%的模型算力利用率,较开源基线提升2.93倍。

AI 深度解读

本文介绍了在昇腾 NPU SuperPOD 上对万亿参数级 MoE 模型 DeepSeek-V4 进行全参数后训练的系统优化实践,实现了 34.22% 的 MFU 和 2.93 倍加速,并针对运筹学任务构建了 CPT/SFT 流程,最终模型在零样本 Pass@1 上达到 71.81%,超越 GPT-5.4-Mini。

  • 针对万亿参数 MoE 模型后训练中的内存压力、通信开销和内核执行效率问题,提出了层次化优化框架,涵盖模型并行、计算-通信编排和底层内核执行。
  • 在昇腾 NPU SuperPOD 上实现 34.22% 的模型算力利用率(MFU),相比开源基线提升 2.93 倍,且保持训练稳定性。
  • 基于优化基础设施,构建了面向复杂运筹学任务的连续预训练(CPT)和监督微调(SFT)流程,整合领域资源与求解器验证的合成数据。
  • 生成包含 10K 高质量 SFT 样本的数据集,覆盖四类任务和三种问题表示。
  • 专用模型 DeepSeek-V4-Flash-OR 在零样本 Pass@1 上平均达 71.81%,超越 GPT-5.4-Mini 和基础模型 3.98 和 11.27 个百分点。
  • 影响/看点:展示了从高效后训练到领域专用模型的全栈路径,验证了昇腾基础设施支持万亿参数模型后训练的可行性,并为运筹学等复杂推理任务提供了可复现的优化方案。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com