OpenAI用GPT-5.6自我优化推理链路,服务成本最多降20%

📡 IT之家2026-07-30 14:06

OpenAI用GPT-5.6 Sol模型自我优化推理内核和调度策略,使生产环境服务成本最多降低20%。

AI 深度解读

OpenAI 把新模型反过来用在自己身上:用 GPT-5.6 Sol 优化 GPT-5.6 系列自身的推理链路,端到端服务成本最多降 20%,这是「AI 优化 AI 基础设施」从概念走向实测落地的又一例证,值得关注它对行业成本曲线的示范效应。

  • 系统按地域、可用容量、加速器类型分配请求,集群内部再按负载、上下文长度、缓存命中等因素二次调度;GPT-5.6 Sol 通过 Codex 分析生产流量、定位负载失衡根源、测试并调整路由启发式规则。
  • 在前向传播环节,模型识别可预计算、可省略或可并行的计算步骤,并用 Codex 自主改写生产环境的 GPU 内核代码。
  • 团队专门让 GPT-5.6 Sol 学习 Triton、Gluon 两种底层编程语言,以便直接优化推理引擎内核,是本次成本下降的主要来源。
  • 用开源工具 FpSan 做浮点数正确性校验,给「AI 写底层代码」上了一道安全阀。
  • 推测性解码环节也被优化,token 生成效率提升超过 15%。
  • 看点:这不是刷榜式的能力秀,而是把模型能力直接变现为可复现的算力成本节省,一旦验证稳定,很可能被友商效仿,推动大模型推理成本进入新一轮下探。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com