阿里千问官方发布 Qwen3.8-Flash-Next:探索极致成本效益的新 MoE 架构

📡 Hacker News 热门2026-08-26 22:05

阿里千问发布Qwen3.8-Flash-Next模型,探索通过新型MoE架构实现极致成本效益。

AI 深度解读

阿里巴巴通义千问团队在8月26日公布Qwen3.8-Flash-Next,开放模型权重并展示面向Qwen4的部分架构探索,关注价值在于它把长上下文效率、参数容量和推理成本作为联合设计目标,而不是只更新模型规模。

  • 模型采用Gated DeltaNet与Qwen Sparse Attention混合架构,前者压缩历史状态,后者以微块为单位筛选重要上下文。
  • 官方披露主模型参数为1250亿,另有510亿N-gram Embedding参数,但每个token激活参数约60亿;其计算成本不能仅按总参数量判断。
  • 模型原生支持262144个token上下文,并可通过YaRN扩展至100万token;官方还报告在特定缓存命中率和长上下文设置下,预填充吞吐相对Qwen3.7-Plus提升。
  • 权重已发布至Hugging Face和ModelScope;Qwen团队同时披露QwenCloud上的Qwen3.8-Flash价格为每百万输入token 0.16美元、输出token 0.47美元,并说明API将在公告后启用。
  • 性能表和成本数据均为发布方测试,涉及不同模型、工具链和评测修订,不能直接推导出所有生产场景的性价比。
  • 影响/看点:如果稀疏注意力、主机内存卸载和小激活规模能在真实流量下稳定工作,长文档和高频智能体任务的单位成本可能下降;成立条件是服务端缓存、部署框架、延迟要求和任务分布与测试设置相近。资料依据: Qwen官方博客《Qwen3.8-Flash-Next:一种新架构,迈向极致的成本效益》,2026年8月26日,https://qwen.ai/blog?id=qwen3.8-flash-next;Qwen团队技术报告《On the Design of Qwen3.8-Next Architecture》,2026年8月,https://github.com/QwenLM;Hugging Face模型库,2026年8月,https://huggingface.co/Qwen

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手