阿里开源 Qwen3.8-Flash 多模态 MoE 模型:作为 Qwen4 架构预览
阿里云开源多模态模型Qwen3.8-Flash,总参数125B仅激活6B,并同步上线API服务且公布价格。
AI 深度解读
阿里云于2026年8月26日发布并上线 Qwen3.8-Flash 多模态 MoE 模型的云端 API 服务与开源权重,为开发者提供高性价比的长上下文推理选项。
- Qwen3.8-Flash 具备 125B 总参数量且每 token 仅激活 6B,官方数据显示其训练成本仅为 Qwen3.7-Plus 的九分之一,兼具低能耗与高吞吐特征。
- 阿里云官方公布的商业化调用定价为输入每百万 token 0.16 美元、输出每百万 token 0.47 美元,在同性能梯队的云端模型服务中具备明显价格优势。
- 上下文能力方面,模型原生支持 262K token,并可通过 YaRN 技术扩展至 1M token,且 API 服务默认提供长上下文接入能力。
- 结合 Qwen 稀疏注意力(QSA)与微块级检索技术,模型在长文档分析与视频多模态理解时能有效降低首字延迟与计算负荷。
- 影响/看点:这一低成本的 API 定价策略可能加剧企业级模型推理市场的价格竞争,其对商业生态的渗透程度取决于长上下文调用时的输出稳定性与多模态服务的高并发可用率。
- 资料依据:
- 1. 阿里云官方 X 账号:https://x.com/alibaba_cloud/status/2092638695933223003
- 2. 阿里云与 Qwen 官方技术与定价文档(2026年8月):https://qwen.ai
- 3. 行业分析与 API 聚合平台 ZenMux(2026年8月):https://zenmux.ai
本内容由 AI 生成,仅供参考,请注意甄别