阿里千问官方开源 Qwen3.8-Flash:多模态 MoE 架构与 Qwen4 早期预览
阿里开源Qwen3.8-Flash,多模态MoE架构并预览Qwen4,支持超长上下文。
AI 深度解读
阿里通义千问团队于2026年8月26日发布并开放Qwen3.8-Flash的模型权重,将其定位为Qwen4架构的早期预览,关注价值在于它把大参数规模、稀疏激活和多模态能力结合到一个可供社区测试的开放模型中。
- Qwen官方资料显示,该模型主模型参数量为125B,另有51B N-gram嵌入参数,每个token激活约6B参数。
- 官方将其描述为多模态MoE模型,并称其训练成本约为Qwen3.7-Plus的九分之一,但该比较属于厂商披露,是否适用于不同训练配置仍取决于硬件、数据和训练方案。
- GitHub官方仓库将其列为Qwen4架构的早期预览,重点变化包括GDN与QSA混合注意力、门控残差、N-gram嵌入和训练优化。
- 官方资料给出的原生上下文长度为262,144 token,并支持通过YaRN扩展到更长上下文;长上下文实际效果仍受显存、推理框架和任务类型影响。
- QwenCloud提供兼容OpenAI和Anthropic接口的服务,官方发布信息给出每百万输入token 0.16美元、输出token 0.47美元的价格。
- 影响/看点:该发布可能降低开发者试用大容量多模态MoE的门槛,并为Qwen4架构提前收集工程反馈;但成本优势能否转化为实际部署优势,要看模型质量、框架适配和长上下文场景下的真实吞吐。
- 资料依据: QwenLM官方GitHub《Qwen3.8-Flash-Next》(2026年8月26日),https://github.com/QwenLM/Qwen3.8-Flash-Next;通义千问官方X公告(2026年8月26日),https://x.com/Alibaba_Qwen/status/2092636376990990503
本内容由 AI 生成,仅供参考,请注意甄别