智谱 GLM 披露递归自我改进实践:利用 Agent 在十万卡国产集群上自建推理系统
智谱披露递归自我改进实践,利用Agent在十万卡国产芯片集群上自主完成推理系统搭建与优化并投入生产。
AI 深度解读
智谱发布文章介绍由 GLM-5.3 驱动的 Infra Agent 参与搭建和优化 GLM-5.3-Flash 推理系统,重点不在模型自动设计自身,而在 Agent 进入推理基础设施调试与性能优化环节。
- 智谱官方文章于 2026-09-17 发布,称系统部署在超过 10 万张国产 AI 加速器组成的集群上。
- 官方称,Infra Agent 参与了从硬件适配到生产级推理服务的建设,周期少于两周。
- 经过多项内存、并行和调度优化,端到端吞吐达到初始基线约 3 倍;官方同时称单位 Token 成本和硬件利用效率接近主流 NVIDIA GPU 水平。
- GLM-5.3-Flash 曾以匿名模型 Ox-Alpha 在 OpenCode 和 OpenRouter 接受真实流量,官方称六天处理超过 62 万亿 Token。
- 文章明确表示尚未达到完全自主的递归自我改进,目标设定、边界控制和风险审核仍由人负责。
- 影响/看点:该案例可能降低超大规模国产集群的适配和优化成本,但结论主要来自厂商披露;能否外推到其他硬件、负载和模型,取决于独立复测与长期稳定性数据。
- 资料依据:
- z.ai《Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure》(2026-09-17):https://z.ai/blog/glm-built-its-inference-infrastructure
- IT之家(2026-09-17):https://www.ithome.com/1/003/705.htm
本内容由 AI 生成,仅供参考,请注意甄别