Qwen3.8-Next 架构设计:评测、效率与训练稳定性

📡 HuggingFace Daily Papers2026-08-31 08:00

介绍1250亿参数稀疏混合专家模型,在较低训练和推理成本下保持较强性能。

AI 深度解读

论文作者于2026年8月31日在arXiv提交了Qwen3.8-Next架构研究,关注点在于如何同时压低训练与推理成本,并维持模型能力和训练稳定性。

  • 论文描述的Qwen3.8-Flash-Next采用稀疏混合专家结构,总参数1250亿,每个Token激活约60亿参数,另有510亿参数存放在加速器之外的n-gram嵌入表。
  • 在14项预训练评测中,该模型有8项超过397B-A17B前代模型,其余项目落后不超过2.6分;论文同时报告激活参数、训练Token和训练浮点运算量分别约降至三分之一、三分之一和九分之一。
  • 架构结合Gated DeltaNet与全局注意力,并引入Qwen Sparse Attention和四分支Gated Residual,以处理长上下文、残差表达和外置参数容量。
  • 作者强调,语言模型损失下降并不必然带来下游准确率同步提升;n-gram词表扩大后损失持续下降,但下游表现趋于饱和。
  • 影响/看点:如果这些结果能在更多任务、硬件和独立复现实验中成立,模型设计可能更重视训练成本、显存占用与稳定性的联合优化,而不能只看参数规模或单一损失指标。
  • 资料依据:
  • Qwen3.8-Next论文(2026-08-31):https://arxiv.org/abs/2608.30320
  • Qwen3.8官方GitHub仓库(2026-08-31):https://github.com/QwenLM/Qwen3.8

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手