华为盘古openPangu-2.0-Pro模型及技术报告正式开源
华为开源505B参数盘古openPangu-2.0-Pro模型权重、推理代码及技术报告,支持512k上下文
AI 深度解读
华为兑现6月HDC上的开源承诺,将参数规模约505B的openPangu-2.0-Pro模型权重、基础推理代码及技术报告全部开源,是继92B的Flash版之后昇腾原生大模型阵营的又一块拼图。
- 模型为昇腾NPU原生训练的MoE架构,总参数505B,单token激活约18B,支持512k超长上下文,训练数据量约34T tokens
- 架构做了多处升级:Attention层用DSA+SWA分层混合降低长序列推理开销,残差连接换成4支流mHC架构提升泛化,自投机模块用3头MTP一次多猜3个token提速,训练侧采用Muon优化器加快收敛
- 后训练走快慢合一SFT+多专项强化学习+在线蒸馏,试图把不同能力融合进单一模型
- 余承东解释505B并非算力不够,而是把更多昇腾算力让给了外部客户,自身更聚焦时延和吞吐的工程优化而非堆参数
- 权重与代码已上线gitcode开源平台
- 看点是华为在美国出口管制背景下,用「开源+昇腾生态绑定」的打法拉拢国内开发者,这次是七大组件开源计划的实质性推进,后续预训练代码、训练算子能否按期跟上更值得盯。
本内容由 AI 生成,仅供参考,请注意甄别