智谱官方分享:GLM-5.3 自建并优化推理基础设施,吞吐量提升 3 倍
智谱分享利用 GLM-5.3 自动化构建并优化自身推理基础设施的实践,两周内将端到端吞吐量提升至初始基线的 3 倍。
AI 深度解读
智谱官方宣布利用 GLM-5.3 驱动的智能体系统构建并优化了服务于 GLM-5.3-Flash 的生产级推理基础设施,实现了端到端吞吐量的成倍增长。
- 系统在超 10 万张国产算力芯片组成的集群上完成落地,从首次跑通到全量承接生产流量耗时不到两周,端到端吞吐量达初始基线的 3.2 倍。
- 基础设施采用了 ReplaySSM 计算换显存、节点内张量并行、INT8/FP8/BF16 混合缓存以及编码-预填-解码(EPD)分离式调度等多项技术组合。
- 优化的核心在于通过多层级自动化验证接口提供局部、低成本的密集反馈,使模型在无需人类工程师深度介入的情况下自主形成并验证调优假设。
- 硬件利用率与推理单 Token 成本经优化后已接近主流 NVIDIA GPU 水平,验证了“模型优化系统”递归自改进路径的工程可行性。
- 影响/看点:该成果表明 AI 系统自动化工程(Infra Agent)能够快速弥补新兴芯片在软件栈上的成熟度短板,关键在于能否将密集反馈框架复用至更多异构硬件生态中。
- 资料依据:
- X:智谱 Z.ai (@Zai_org)(2026-09-17):https://x.com/Zai_org/status/2100481236364079277
- 智谱开放平台官方技术博客(2026-09-17):https://bigmodel.cn/dev/howtos/glm-5-3-flash-infra-agent
本内容由 AI 生成,仅供参考,请注意甄别