通义千问发布 Qwen3.8-Flash-Next:MoE 结合 N-gram 嵌入,SGLang 首日支持
Qwen3.8-Flash-Next引入N-gram嵌入与混合注意力,SGLang已支持部署。
AI 深度解读
通义千问于2026年8月26日发布Qwen3.8-Flash-Next,并将其作为Qwen4架构的早期预览版本,SGLang同步提供部署支持,关注价值在于模型结构变化与推理生态适配几乎同时公开。
- 官方GitHub资料显示,模型采用GDN与QSA混合注意力:前者压缩历史状态,后者通过轻量索引器选择长上下文中的重要片段。
- 模型包含125B主模型参数和51B N-gram嵌入参数,每个token激活约6B参数;N-gram表可卸载到主机内存,并通过异步预取与计算重叠。
- 这类设计试图在保持较大参数容量的同时控制每次计算量,但主机内存带宽、通信和调度开销仍可能影响实际收益。
- SGLang官方示例支持以四路张量并行部署,并设置262,144 token上下文长度,同时提供Qwen3推理解析器和工具调用解析器。
- 官方把该模型定位为多模态MoE和Qwen4架构预览,仓库同时说明完整评测结果发布在Qwen官方博客中;因此结构可用性与最终任务质量需要分别观察。
- 影响/看点:如果混合注意力、N-gram嵌入和异步预取能在不同硬件上稳定协同,模型长任务推理的单位成本可能下降;成立条件是框架内核成熟、显存与主机内存配置匹配,并且端到端延迟而非单项算力指标得到改善。
- 资料依据: QwenLM官方GitHub《Qwen3.8-Flash-Next》(2026年8月26日),https://github.com/QwenLM/Qwen3.8-Flash-Next;通义千问官方X公告(2026年8月26日),https://x.com/Alibaba_Qwen/status/2092610229578125817;SGLang官方GitHub发布页,https://github.com/sgl-project/sglang/releases
本内容由 AI 生成,仅供参考,请注意甄别