Qwen3.8-Flash-Next 获 vLLM 首日支持,已适配 NVIDIA 与 AMD GPU

📡 通义千问 / Qwen2026-08-26 21:17

Qwen3.8-Flash-Next获vLLM首日支持,并已验证可运行于英伟达和AMD GPU。

AI 深度解读

通义千问于2026年8月26日宣布Qwen3.8-Flash-Next获得vLLM首日支持,并称已在NVIDIA和AMD GPU上完成验证,关注价值在于开放模型发布与主流推理框架、不同GPU生态的适配同步推进。

  • Qwen官方信息显示,模型采用稀疏多模态MoE结构,主模型参数量125B,每个token激活约6B参数,并附带51B N-gram嵌入表。
  • 官方给出的原生上下文长度为262,144 token,使用YaRN可扩展到1M token;部署时的可用长度还会受到显存、批量大小和缓存策略限制。
  • Qwen官方提供的vLLM启动方式使用四路张量并行、Qwen推理解析器和工具调用解析器,并开放OpenAI兼容接口。
  • Qwen官方GitHub同时列出SGLang、vLLM和Transformers等支持路径,但“可以启动”与“在生产负载下达到稳定吞吐”是两个不同指标。
  • NVIDIA和AMD的适配意味着软件栈需要分别处理不同的算子、显存和通信机制,跨厂商验证有助于减少部署锁定,但不能自动消除性能差异。
  • 影响/看点:首日框架支持可能缩短开发者从模型发布到实验部署的时间,并提高多硬件环境下的可测试性;实际影响取决于版本稳定性、算子覆盖、量化支持和长上下文任务中的端到端性能。
  • 资料依据: 通义千问官方X公告(2026年8月26日),https://x.com/Alibaba_Qwen/status/2092602306986750256;QwenLM官方GitHub《Qwen3.8-Flash-Next》(2026年8月26日),https://github.com/QwenLM/Qwen3.8-Flash-Next;vLLM官方GitHub项目,https://github.com/vllm-project/vllm

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手