阿里开源 Qwen3.8-Flash:125B 多模态 MoE 模型,训练成本降至前代 1/9

📡 IT之家2026-08-26 20:39

阿里开源125B多模态MoE模型Qwen3.8-Flash,训练成本降至前代九分之一,原生支持256K上下文。

AI 深度解读

阿里巴巴通义千问团队于 2026 年 8 月 26 日开源 125B 多模态混合专家(MoE)模型 Qwen3.8-Flash-Next 权重,其通过稀疏激活与混合架构设计,在降低训练与推理计算开销的同时探索下一代模型的技术路径。

  • 架构与参数设计:主模型总参数量为 125B,每个 token 激活 6B 参数,原生支持 262K 上下文并可扩展至 1M;引入 51B 参数的 N-gram Embedding 查表机制,支持卸载至主机内存进行异步预取,降低 GPU 显存持续占用。
  • 注意力与残差机制:采用门控 DeltaNet 与稀疏注意力(QSA)混合结构,在微块粒度筛选上下文以降低长序列计算开销;残差流引入门控机制并支持 FP8 存储,用以缩减访存需求。
  • 训练成本与基准测试:据 IT 之家与 QwenLM 官方 GitHub 技术报告于 2026 年 8 月 26 日公布的数据,该模型训练成本约为 Qwen3.7-Plus 的九分之一,在 6B 激活参数下于 MMLU-Pro、SuperGPQA、BBH 及 SWEBench-Pretrain 等多个基准测试中取得同规模下较优成绩。
  • 开源交付与服务定价:开源权重已上线 Hugging Face 与 ModelScope 平台,官方 API 服务定价为输入每百万 token 1 元、输出 3 元。
  • 影响/看点:该架构若能在实际工程部署中维持低延迟与显存控制优势,可能为长上下文及低成本推理场景提供更经济的高参数量方案,其实际效益取决于主机内存与显卡间传输带宽瓶颈及复杂业务场景中的泛化表现。
  • 资料依据:
  • IT 之家报道(2026年8月26日)https://www.ithome.com/0/994/735.htm
  • QwenLM GitHub 技术报告(2026年8月26日)https://github.com/QwenLM/Qwen3.8-Flash-Next

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手