在 NVIDIA GB300 NVL72 上部署与体验 Qwen3.8-Flash-Next 智能体编程
英伟达介绍在GB300 NVL72上部署Qwen3.8-Flash-Next进行智能体编程。
AI 深度解读
NVIDIA于2026年8月发布文章介绍在GB300 NVL72上部署Qwen3.8-Flash-Next的方案,关注价值在于它把一个开放权重、多模态、稀疏激活模型放入数据中心级硬件环境,展示模型架构与推理基础设施之间的协同关系。
- NVIDIA资料称,该模型总参数量为176B,其中包括51B N-gram嵌入参数,每个token激活约6B参数;这一口径与Qwen官方对主模型和附加嵌入表的拆分方式有关。
- 文章提到模型原生上下文长度为262,144 token,并可通过YaRN扩展到1M token;长上下文能否稳定运行仍取决于显存、缓存管理和应用负载。
- GB300 NVL72将72张Blackwell Ultra GPU置于同一大规模NVLink域,NVIDIA将其作为MoE专家通信和高并发推理的基础设施。
- 该文章主要展示部署与体验路径,平台能力、吞吐表现和成本结论不能直接外推到消费级GPU或其他云环境。
- Qwen官方GitHub同时提供SGLang、vLLM和Transformers等运行方式,说明模型发布重点不仅是单一硬件验证,也包括扩大推理框架可用性。
- 影响/看点:如果开放模型能够在大规模互联系统上获得可预测的长上下文吞吐,数据中心部署选择可能更重视模型稀疏结构与通信拓扑的匹配;这一影响成立的前提是硬件采购、功耗、软件优化和实际并发需求能够共同覆盖部署成本。
- 资料依据: NVIDIA Technical Blog《Experiment with Qwen3.8-Flash-Next 176B Model on NVIDIA GB300 NVL72 for Agentic Coding》(2026年8月),https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-176b-model-on-nvidia-gb300-nvl72-for-agentic-coding/;QwenLM官方GitHub《Qwen3.8-Flash-Next》(2026年8月26日),https://github.com/QwenLM/Qwen3.8-Flash-Next
本内容由 AI 生成,仅供参考,请注意甄别