智谱官方发布 GLM-5.3-Flash 原生多模态模型

📡 Hacker News 热门2026-08-26 22:38

智谱官方正式发布GLM-5.3-Flash原生多模态模型。

AI 深度解读

智谱AI发布GLM-5.3-Flash,官方定位为GLM-5系列首个原生多模态模型,关注价值在于其将多模态输入、稀疏与线性注意力结合,以及较小的激活参数规模放在同一款可本地部署模型中。

  • 官方模型卡称,该模型总参数量为3200亿、每个token激活180亿参数,并采用重新训练的基础模型与新的训练方案。
  • 架构上引入稀疏注意力与线性注意力的混合设计,并加入Manifold-Constrained Hyper-Connections,官方解释是为降低长上下文服务成本和改善扩展效率。
  • 模型卡列出图像与文本混合输入示例,并提供Transformers、vLLM、SGLang和KTransformers等部署路径。
  • 官方材料还称其使用了30000亿token规模的多模态预训练语料,并在部分基准和真实任务上超过GLM-5.2;这些性能比较仍属于发布方自测,需要结合统一评测条件解读。
  • 输入条目把它概括为“原生多模态模型”,这一表述可以由官方模型卡支持,但“十分之一价格”等商业判断需要对应API价格表与相同调用条件才能成立。
  • 影响/看点:若本地部署、长上下文和图文处理都能在实际工作负载中保持稳定,模型选择空间可能扩大;是否形成成本优势,取决于显存配置、量化方案、吞吐、服务价格和任务质量。资料依据: Z.ai官方博客《GLM-5.3-Flash》,2026年8月26日,https://z.ai/blog/glm-5.3-flash;Hugging Face官方模型卡《zai-org/GLM-5.3-Flash》,2026年8月,https://huggingface.co/zai-org/GLM-5.3-Flash;GLM-5技术报告,2026年2月,https://arxiv.org/abs/2602.15763

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手