智谱官方正式发布 GLM-5.3-Flash:开源 320B 原生多模态模型并支持 1M 上下文

📡 智谱 Z.ai2026-08-26 22:12

智谱发布并开源GLM-5.3-Flash,支持原生多模态和约104万Token上下文。

AI 深度解读

智谱发布 GLM-5.3-Flash,并公开 320B 总参数、18B 激活参数的原生多模态模型,关注价值在于其把长上下文、视觉能力与低成本推理结合到开放权重模型中。

  • 智谱于2026年8月26日在官方博客介绍该模型,称其支持最长约100万 token 上下文,并采用稀疏注意力与线性注意力混合架构。
  • Hugging Face 官方模型卡显示,模型权重以 MIT License 发布,可通过 vLLM、SGLang 和 TokenSpeed 等框架部署。
  • “320B”是总参数规模,“18B”是推理时激活参数规模,两者反映的是模型容量与单次计算量的不同维度,不能直接等同于运行成本。
  • 智谱公布的 DeepSWE、AutomationBench 等结果属于厂商测试,实际表现还会受到提示词、推理框架、硬件和评测协议影响。
  • 官方博客还称模型曾以 Ox Alpha 匿名运行,并在中国 AI 芯片上承载流量,但这说明的是测试与部署背景,不等于所有用户环境都能复现相同效率。
  • 影响/看点:如果开放权重、1M 上下文和较低激活规模能在独立测试中保持稳定,模型可能降低长文档和多模态代理任务的部署门槛;其实际价值取决于硬件适配、显存需求、推理速度与许可证使用边界。
  • 资料依据: Z.ai《GLM-5.3-Flash: Frontier Intelligence, Flash Cost》(2026年8月26日) https://z.ai/blog/glm-5.3-flash;Hugging Face 官方模型卡 https://huggingface.co/zai-org/GLM-5.3-Flash

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手