智谱上线 GLM-5.3-FlashX 推理加速模型,最高达 200 tokens/s
智谱上线 GLM-5.3-FlashX 推理加速模型,推理速度最高可达 200 tokens/s。
AI 深度解读
智谱上线推理加速模型 GLM-5.3-FlashX,官方标称生成速率最高可达 200 tokens/s,旨在提升高频调用场景下的吞吐表现。
- 智谱大模型开放平台正式推出 GLM-5.3-FlashX,在国产算力芯片基础设施基础上强化底层推理优化,峰值生成速率达到 200 tokens/s。
- 该模型支持 1M 上下文长度,并具备文本、图像、视频和文件等多模态输入理解能力。
- 在调用资费上,GLM-5.3-FlashX 输入与输出价格设定为每百万 Tokens 2 元和 7 元,上下文缓存命中为 0.57 元,处于基础 Flash 版与标准版 GLM-5.3 之间。
- 影响/看点:兼顾 1M 窗口、多模态支持与高速吞吐的定价策略,面向高并发 Agent 循环与即时对话场景提供了折中方案,其实际效能取决于在高负载复杂推理下的生成质量与吞吐稳定性。
- 资料依据:
- IT之家(2026-09-18):https://www.ithome.com/1/004/061.htm
- 智谱大模型开放平台文档(2026-09-18):https://docs.bigmodel.cn/api-reference/%E6%A8%A1%E5%9E%8B-api/%E5%AF%B9%E8%AF%9D%E8%A1%A5%E5%85%A8
本内容由 AI 生成,仅供参考,请注意甄别