PolyAI 发布 Dialog-RSN-1:融合轮次判断、语音识别与函数调用的音频原生对话模型
PolyAI推出音频原生对话模型Dialog-RSN-1,将轮次判断、语音识别、函数调用与应答融合一体,已用于实际客服通话,响应延迟低于300毫秒。
AI 深度解读
语音 AI 公司 PolyAI 发布 Dialog-RSN-1,把话轮判断、语音识别、函数调用和回复生成揉进一个直接“听”原始音频的模型,不再靠先转写成文本再交给大模型的老路,而且已经在真实电话场景里跑生产流量,是电话客服自动化从“拼装式”转向“端到端理解”的一个信号。
- 模型只在输入侧原生感知音频,输出仍交给独立、可提示控制的 TTS,音色不被模型焗死、保留可控性
- 采用按需请求式推理,靠高召回的语音活动检测加几个计时器决定何时探测模型,不像全双工语音模型那样常驻占用 GPU
- 话轮判断是模型的第一个输出 token(空、进行中或结束三选一),廉价声学线索只负责“何时问”,模型本身结合完整上下文做“说不说话”的最终判断
- 官方数据显示响应延迟低于300毫秒,某连锁餐饮客户的“问题解决率”提升11%,某保险公司延迟降低37%
- 目前仅支持英语,不开源、无公开 API,只通过 PolyAI 平台服务其现有100多家企业客户及2000多条生产部署,面向的是餐饮、保险、金融、医疗、酒店等高话务量行业
- 相比 GPT Realtime、Gemini Live 这类把音色焗死在模型里、且常驻占卡的语音到语音方案,Dialog-RSN-1“音频原生输入+可控 TTS 输出+按需推理”的折中架构更贴合电话客服这类高并发、强合规音色要求的商业场景,做语音 Agent 或呼叫中心自动化的团队值得重点关注这条架构路线,而不是一味跟风全双工语音模型。
本内容由 AI 生成,仅供参考,请注意甄别