千问新开源 MoE 模型 Qwen3.8-Flash-Next 尝鲜实测
阿里千问开源多模态 MoE 架构预览模型 Qwen3.8-Flash-Next,开发者分享了基于量化版本的实测体验。
AI 深度解读
阿里通义千问团队于 2026 年 8 月 26 日开源混合专家架构模型 Qwen3.8-Flash-Next,作为下一代 Qwen4 架构的早期技术预览,其低激活参数与大容量嵌入的设计引起了开源社区在本地部署上的实测关注。
- 根据通义千问官方博客发布的技术细节,该模型总参数量为 1250 亿,并包含 510 亿参数的 N-gram 嵌入表,而在推理时每个 Token 仅激活 60 亿参数,以控制单次计算开销。
- 架构设计上结合了门控 DeltaNet 与稀疏注意力(QSA)混合机制,支持 26.2 万 Token 的原生上下文长度,并可通过 YaRN 技术拓展至 100 万 Token。
- 开发者 Simon Willison 于 2026 年 8 月 26 日在个人博客发布了实测记录,其使用量化版本(如 78.9GB 的 UD-Q2_K_XL)在 DGX Spark 硬件上运行高推理强度测试,验证了该大容量模型在本地工作站环境下的推理可行性。
- 影响/看点:该架构探索意味着未来开源大模型可能通过高稀疏度 MoE 与外部嵌入表在保持较低计算负载的同时扩展知识容量,但其实际普及仍取决于工作站与消费级硬件在内存容量与带宽上的承载门槛。
- 资料依据:通义千问官方技术博客(https://qwen.ai/blog?id=qwen3.8-flash-next);Simon Willison 个人博客实测记录(https://simonwillison.net/2026/Aug/26/qwen38-flash-next/)。
本内容由 AI 生成,仅供参考,请注意甄别