阿里千问发布 Qwen3.8-Flash-Next:提前引入 Qwen4 稀疏注意力与残差架构

📡 SemiAnalysis2026-08-27 03:00

阿里发布Qwen3.8-Flash-Next,提前采用Qwen4的稀疏注意力、门控残差连接等架构。

AI 深度解读

阿里通义千问发布 Qwen3.8-Flash-Next,并提前公开下一代架构方向,关注价值在于其把模型能力扩展与推理成本控制放在同一设计框架内。

  • Qwen 团队在 GitHub 项目说明中称,该模型于 2026 年 8 月 26 日发布,采用 Gated DeltaNet 与 Qwen Sparse Attention 的混合注意力设计。
  • Qwen Sparse Attention 通过轻量索引器按微块选择重要上下文,目标是降低长上下文注意力计算量;这是架构设计目标,不等同于所有任务中的已验证收益。
  • 模型还加入四分支 Gated Residual,以及可卸载到主机内存的 N-gram Embedding,后者以增加参数容量换取较低的额外计算需求。
  • 官方披露主模型参数量为 1250 亿,另有 510 亿 N-gram Embedding,每个令牌激活 60 亿参数,并称相较 Qwen3.7-Plus,训练成本约为其九分之一。
  • 上述成本和能力结论来自 Qwen 团队披露,是否适用于不同硬件、批量大小、上下文长度和任务类型,还需要独立复现实验。
  • 影响/看点:若稀疏注意力、主机内存卸载和门控残差能在实际服务中稳定协同,可能改善长上下文模型的单位成本;但其部署复杂度、内存带宽和框架支持会决定理论效率能否转化为生产收益。
  • 资料依据:QwenLM/Qwen3.8-Flash-Next 官方 GitHub(2026年8月26日)https://github.com/QwenLM/Qwen3.8-Flash-Next
  • Qwen 团队《Qwen3.8-Flash-Next》技术报告入口(2026年8月)https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手