OpenAI 实时语音模型 GPT-Live-1 上线 API:支持打断与电话智能体

📡 IT之家2026-09-11 08:28

OpenAI 将 GPT-Live-1 语音模型上线 API,整合语音识别与合成,支持全双工交互、打断处理及电话智能体。

AI 深度解读

OpenAI 于 2026 年 9 月 10 日将全双工实时语音模型 GPT-Live-1 接入 API,为开发者构建低延迟的电话与实时交互智能体提供了端到端语音架构。

  • 模型将语音识别理解与音频生成整合于一体,支持在对话过程中实时响应打断、停顿与环境杂音,减少了传统多环节级联带来的转换延迟。
  • 系统采用前后端分工架构,前端语音层专职维持语速、语调及轮次检测,复杂推理与外部工具调用则交由后端文本模型处理。
  • 早期评估数据显示,语言学习平台接入后在用户思考停顿期间的误打断降低近 80%,但在复杂逻辑场景下仍依赖后端模型的推理配合。
  • 计费方面,前端语音层单价为每分钟 0.05 美元(折合每小时约 3 美元),后端大模型调用及相关工具费用另行计费。
  • 影响/看点:该架构可能降低电话与实时客服类智能体的工程开发复杂度并改善自然交互体验,但实际商用效果取决于复杂工具调用时的端到端响应延迟与多模型协同下的总体使用成本。
  • 资料依据:
  • OpenAI(2026-09-10):https://openai.com/index/introducing-gpt-live-1
  • IT之家(2026-09-11):https://www.ithome.com/1/001/091.htm

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手