[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"aihot-art-102758":3},{"itemId":4,"vertical":5,"category":6,"source":7,"score":8,"title":9,"summary":10,"analysis":11,"url":12,"coverUrl":13,"direction":13,"marketSignal":13,"publishedAt":14},"102758","ai","论文研究","HuggingFace Daily Papers",66,"SLAI T-Rex：在昇腾 SuperPOD 上对 DeepSeek-V4 系列进行全参数后训练","在昇腾NPU SuperPOD上对万亿参数MoE模型DeepSeek-V4进行全参数后训练，实现34.22%的模型算力利用率，较开源基线提升2.93倍。","本文介绍了在昇腾 NPU SuperPOD 上对万亿参数级 MoE 模型 DeepSeek-V4 进行全参数后训练的系统优化实践，实现了 34.22% 的 MFU 和 2.93 倍加速，并针对运筹学任务构建了 CPT\u002FSFT 流程，最终模型在零样本 Pass@1 上达到 71.81%，超越 GPT-5.4-Mini。\n\n· 针对万亿参数 MoE 模型后训练中的内存压力、通信开销和内核执行效率问题，提出了层次化优化框架，涵盖模型并行、计算-通信编排和底层内核执行。\n· 在昇腾 NPU SuperPOD 上实现 34.22% 的模型算力利用率（MFU），相比开源基线提升 2.93 倍，且保持训练稳定性。\n· 基于优化基础设施，构建了面向复杂运筹学任务的连续预训练（CPT）和监督微调（SFT）流程，整合领域资源与求解器验证的合成数据。\n· 生成包含 10K 高质量 SFT 样本的数据集，覆盖四类任务和三种问题表示。\n· 专用模型 DeepSeek-V4-Flash-OR 在零样本 Pass@1 上平均达 71.81%，超越 GPT-5.4-Mini 和基础模型 3.98 和 11.27 个百分点。\n\n影响\u002F看点：展示了从高效后训练到领域专用模型的全栈路径，验证了昇腾基础设施支持万亿参数模型后训练的可行性，并为运筹学等复杂推理任务提供了可复现的优化方案。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.20145",null,"2026-07-22 08:00:00"]