谷歌发布语音转文本模型 Gemini 3.5 Transcribe,平均词错率降至 2.6%
谷歌发布 Gemini 3.5 Transcribe 语音模型,提供实时与离线双接口,平均词错率降至 2.6%。
AI 深度解读
谷歌于2026年8月发布语音转文本模型 Gemini 3.5 Transcribe,该模型通过分离预录与实时接口来兼顾转写精度与流式交互响应。
- 架构设计采用双接口分流:Interactions API 下的 gemini-3.5-transcribe 面向预录音频文件,提供说话人分离、词级时间戳和自定义词汇偏置;Live API 下的 gemini-3.5-transcribe-live 面向双向实时流式传输,支持亚秒级延迟与临时令牌鉴权,但单次会话限制在10分钟内且不支持说话人分离。
- 据 Artificial Analysis 独立评测数据,该模型非流式平均词错率(WER)为2.6%,流式平均词错率为4.0%,相比前代 Chirp 3 转写收敛时间缩短70%,并支持超过85种语言的自动检测与句中语种混杂识别。
- 交付模式仅采用托管 API,不提供开放权重或本地部署方案,开发者可通过 Google AI Studio 或企业级 Agent 平台接入。
- 影响/看点:双端点解耦设计意味着开发团队必须根据业务链路分别构建离线处理与实时交互逻辑;若其低词错率与多语种混说识别在实际复杂噪声环境中得到验证,可能有助于改善跨国会议纪要与智能语音客服的转写质量。
- 资料依据:
- 1. 谷歌官方发布文档(2026年8月):https://blog.google/technology/ai/
- 2. MarkTechPost 报道(2026年8月27日):https://www.marktechpost.com/2026/08/27/google-ai-releases-gemini-3-5-transcribe-a-speech-to-text-model-reporting-2-6-average-wer-across-85-languages/
本内容由 AI 生成,仅供参考,请注意甄别