OpenAI用GPT-5.6自我优化推理链路,服务成本最多降20%
OpenAI用GPT-5.6 Sol模型自我优化推理内核和调度策略,使生产环境服务成本最多降低20%。
AI 深度解读
OpenAI 把新模型反过来用在自己身上:用 GPT-5.6 Sol 优化 GPT-5.6 系列自身的推理链路,端到端服务成本最多降 20%,这是「AI 优化 AI 基础设施」从概念走向实测落地的又一例证,值得关注它对行业成本曲线的示范效应。
- 系统按地域、可用容量、加速器类型分配请求,集群内部再按负载、上下文长度、缓存命中等因素二次调度;GPT-5.6 Sol 通过 Codex 分析生产流量、定位负载失衡根源、测试并调整路由启发式规则。
- 在前向传播环节,模型识别可预计算、可省略或可并行的计算步骤,并用 Codex 自主改写生产环境的 GPU 内核代码。
- 团队专门让 GPT-5.6 Sol 学习 Triton、Gluon 两种底层编程语言,以便直接优化推理引擎内核,是本次成本下降的主要来源。
- 用开源工具 FpSan 做浮点数正确性校验,给「AI 写底层代码」上了一道安全阀。
- 推测性解码环节也被优化,token 生成效率提升超过 15%。
- 看点:这不是刷榜式的能力秀,而是把模型能力直接变现为可复现的算力成本节省,一旦验证稳定,很可能被友商效仿,推动大模型推理成本进入新一轮下探。
本内容由 AI 生成,仅供参考,请注意甄别