OpenAI 正式在 API 中开放 GPT-Live-1 全双工实时语音模型
OpenAI在API中上线GPT-Live-1实时语音模型,支持全双工语音交互与边说边听能力。
AI 深度解读
OpenAI 正式在开发者 API 中开放全双工实时语音模型 GPT-Live-1,允许开发者直接构建可自然双向交谈且支持即时打断的语音应用。
- 交互架构采用全双工(full-duplex)模式,支持在模型持续收听与即时发声的同时,异步将复杂推理与工具调用任务委托给后端模型处理。
- 模型内置电话集成(Telephony)接口、长会话上下文管理、背景降噪以及实时打断响应,简化了语音智能体的工程编排链路。
- 根据官方公布信息,该模型 API 定价为每分钟 0.05 美元,旨在将 ChatGPT 语音模式的核心底座能力开放给第三方生态。
- 影响/看点:该模型的开放有望降低高质量实时语音智能体的构建门槛,但其规模化落地效果仍取决于后端推理协同的延迟表现与端到端运行成本。
- 资料依据:
- X:Sherwin Wu(2026-09-11):https://x.com/sherwinwu/status/2098241241020572040
- OpenAI 官方文档(2026-09-10):https://platform.openai.com/docs/guides/voice-agents
本内容由 AI 生成,仅供参考,请注意甄别