架构解析:智谱 GLM-5.3-Flash 与阿里 Qwen3.8-Flash-Next 为何不谋而合

📡 MarkTechPost2026-08-29 03:12

智谱与阿里近期独立发布的新模型在混合注意力、压缩索引及 Muon 优化器等底层架构设计上展现出高度趋同。

AI 深度解读

科技分析媒体 MarkTechPost 于 2026 年 8 月 28 日发布架构对比分析,指出智谱 AI 发布的 GLM-5.3-Flash 与阿里巴巴发布的 Qwen3.8-Flash-Next 在核心架构设计上呈现出高度一致的演进收敛。

  • 两家实验室在独立研发背景下,均采用了 3:1 的线性注意力(Linear Attention)与全注意力(Full Attention)混合层配比,通过线性层恒定计算开销的特性缓解长上下文推理中的计算负担。
  • 两者均采用上限为 2048 Token 的压缩索引器进行上下文检索,并将残差流拓宽为 4 个门控分支,同时均选用 Muon 优化器进行模型训练。
  • GLM-5.3-Flash 总参数量为 320B(激活 18B),原生支持 1M 上下文;Qwen3.8-Flash-Next 主模型为 125B(激活 6B)并配合 51B n-gram 嵌入表,训练算力消耗约为前代 Qwen3.7-Plus 的九分之一。
  • 影响/看点:两大团队在长上下文与混合注意力架构上的技术收敛,意味着兼顾常数级状态记忆与稀疏注意力的设计正在成为高能效大模型的基础范式,其广泛落地取决于针对特定硬件算子的工程优化程度。
  • 资料依据:
  • 1. MarkTechPost,https://www.marktechpost.com/2026/08/28/glm-5-3-flash-vs-qwen3-8-flash-next-two-chinese-ai-labs-independently-converge-on-the-same-model-architecture/

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手