OpenAI 在 API 中上线 GPT-Live-1:支持全双工实时语音与电话集成
OpenAI 在 API 中上线 GPT-Live-1 模型,提供全双工实时语音交互、自定义声音与电话系统集成。
AI 深度解读
OpenAI 在 API 平台上线端到端实时语音模型 GPT-Live-1,支持全双工语音交互并可与电话系统集成。
- 采用单一模型直接联合推理输入与输出音频,替代传统的「语音识别-大模型推理-语音合成」串联管线,降低级联延迟并减少会话断点。
- 具备实时打断处理能力,在早期测试中相比传统轮流对话系统将不必要的中断减少约 80%。
- 支持将复杂推理和工具调用委托给 GPT-6 Astra 等后端文本模型,兼顾实时交互与深度决策能力。
- 提供静默上下文管理与电话协议支持,开发者可通过系统提示词调节音调、语速和会话风格。
- 影响/看点:该模型有望改善实时电话客服和语言教学等场景的互动自然度,其规模化落地前提是音频端到端调用的单位成本及网络抖动环境下的表现稳定性。
- 资料依据:
- OpenAI(2026-09-10):https://openai.com/index/introducing-gpt-live-1-in-the-api
本内容由 AI 生成,仅供参考,请注意甄别