NVIDIA技术博客:用于生物基础模型的高效MoE架构训练优化
英伟达介绍用于生物基础模型的高效MoE架构训练优化方案,通过稀疏激活降低大模型训练与推理的算力消耗。
AI 深度解读
NVIDIA 技术博客发布了针对生物基础模型的高效混合专家(MoE)架构训练优化方案,旨在解决长序列生物数据与大参数规模带来的算力瓶颈。
- NVIDIA 于 2026 年 9 月 24 日发布的技术博客显示,该方案结合 Transformer Engine(TE)与 BioNeMo 框架,利用 GroupedLinear 原语将多个专家的矩阵乘法合并为单一分组操作,减少了逐个专家 Python 循环引发的算子启动与调度开销。
- 方案引入了 TE 顺序接口,将分组线性变换、ScaledSwiGLU 激活以及路由权重缩放融合为单一算子,并结合 NVIDIA Blackwell 架构支持的 MXFP8 块缩放精度以降低显存占用。
- 在 8 张 NVIDIA B200 GPU 的基准测试中,优化后的 Mixtral 结构生物模型训练吞吐量达到 Hugging Face 基线的 2.21 倍。
- 影响/看点:该方案为基因组、蛋白质等高维度生物大模型的 MoE 化训练提供了工程范式,意味着在具备新型低精度硬件支持的条件下,生物计算领域的预训练周期与算力消耗有望得到改善。
- 资料依据:
- NVIDIA Technical Blog(2026-09-24):https://developer.nvidia.com/blog/efficient-moe-training-for-biological-foundation-models/
- GitHub NVIDIA-BioNeMo/bionemo-recipes(2026-09-24):https://github.com/NVIDIA-BioNeMo/bionemo-recipes/tree/main/recipes/mixtral_native_te
本内容由 AI 生成,仅供参考,请注意甄别