Google DeepMind 推出 Gemini 3.5 Transcribe 智能语音转录模型
Google DeepMind发布Gemini 3.5 Transcribe,用于更智能的语音转文字。
AI 深度解读
Google DeepMind于2026年8月发布Gemini 3.5 Transcribe语音转录模型,面向实时语音交互和录音处理提供两类API,关注价值在于语音识别从“逐字转写”进一步加入格式整理、说话人归属和工具调用等任务能力。
- Google DeepMind表示,实时流式接口通过Live API提供双向流式处理,模型名称为gemini-3.5-transcribe-live,并面向交互式语音应用设计。
- 录音处理接口通过Interactions API提供说话人标注和词级时间戳,可用于会议录音、通话记录和其他预录音频。
- 官方描述的智能转写能力包括处理自我更正、删除口头填充词、自动格式化,以及适配用户提供的自定义词汇。
- Google援引Artificial Analysis的测量称,流式场景平均词错误率为4.0%,非流式场景为2.6%;该数字反映特定测评条件,不能直接等同于所有语言、行业术语和噪声环境下的准确率。
- 官方称模型可自动识别并转录超过85种语言,并已用于Gemini应用和Android相关语音功能,开发者可通过Google AI Studio和Gemini Enterprise Agent Platform调用。
- 影响/看点:这类模型可能减少语音产品中“识别、清洗、格式化、后处理”多组件串联的复杂度;实际影响取决于延迟、价格、隐私处理、语言覆盖质量,以及在医疗、客服等高术语场景中能否保持稳定准确。
- 资料依据: Google DeepMind Blog《Intelligent transcription with Gemini 3.5 Transcribe》(2026年8月),https://deepmind.google/blog/intelligent-transcription-with-gemini-3-5-transcribe/
本内容由 AI 生成,仅供参考,请注意甄别