Qwen3.8-Flash-Next 获 vLLM 首日支持,已适配 NVIDIA 与 AMD GPU
Qwen3.8-Flash-Next获vLLM首日支持,并已验证可运行于英伟达和AMD GPU。
AI 深度解读
通义千问于2026年8月26日宣布Qwen3.8-Flash-Next获得vLLM首日支持,并称已在NVIDIA和AMD GPU上完成验证,关注价值在于开放模型发布与主流推理框架、不同GPU生态的适配同步推进。
- Qwen官方信息显示,模型采用稀疏多模态MoE结构,主模型参数量125B,每个token激活约6B参数,并附带51B N-gram嵌入表。
- 官方给出的原生上下文长度为262,144 token,使用YaRN可扩展到1M token;部署时的可用长度还会受到显存、批量大小和缓存策略限制。
- Qwen官方提供的vLLM启动方式使用四路张量并行、Qwen推理解析器和工具调用解析器,并开放OpenAI兼容接口。
- Qwen官方GitHub同时列出SGLang、vLLM和Transformers等支持路径,但“可以启动”与“在生产负载下达到稳定吞吐”是两个不同指标。
- NVIDIA和AMD的适配意味着软件栈需要分别处理不同的算子、显存和通信机制,跨厂商验证有助于减少部署锁定,但不能自动消除性能差异。
- 影响/看点:首日框架支持可能缩短开发者从模型发布到实验部署的时间,并提高多硬件环境下的可测试性;实际影响取决于版本稳定性、算子覆盖、量化支持和长上下文任务中的端到端性能。
- 资料依据: 通义千问官方X公告(2026年8月26日),https://x.com/Alibaba_Qwen/status/2092602306986750256;QwenLM官方GitHub《Qwen3.8-Flash-Next》(2026年8月26日),https://github.com/QwenLM/Qwen3.8-Flash-Next;vLLM官方GitHub项目,https://github.com/vllm-project/vllm
本内容由 AI 生成,仅供参考,请注意甄别