Gemini 3.5 Transcribe 语音转录 API 发布:WER 2.6% 且支持 85+ 种语言

📡 Artificial Analysis2026-08-27 03:34

Google推出两款Gemini 3.5语音转录API,支持85种以上语言及预录、实时转录。

AI 深度解读

Google 发布 Gemini 3.5 Transcribe 与 Transcribe Live API,分别面向预录音频和实时流式转录,关注价值在于语音接口开始同时竞争识别准确率、响应延迟、语言覆盖和上下文处理能力。

  • Google 官方博客于 2026 年 8 月 26 日称,预录音频版本通过 Interactions API 提供说话人归属和词级时间戳,实时版本通过 Live API 提供双向流式处理。
  • Google 引用 Artificial Analysis 的测量结果称,非流式平均词错误率为 2.6%,流式为 4.0%;这是特定评测条件下的结果,不能直接代表所有语言和噪声环境。
  • 官方还称,模型支持超过 85 种语言,预录音频模式可识别最多三名说话人,三人以上属于实验性支持。
  • Google 在同一篇公告中表示,模型在其 FLEURS 测试集合上的非流式和流式词错误率分别为 5.04% 和 5.50%,与前述第三方测量口径不同。
  • 产品目前以公开预览形式提供,实际使用还会受到 API 价格、区域可用性、配额、音频质量和说话人重叠等因素影响。
  • 影响/看点:如果低延迟和多语言能力能在真实会议、客服及语音代理场景中稳定表现,开发者可能减少自建语音管线的工作;但采购判断仍应以目标语言、行业术语和端到端延迟测试为依据。
  • 资料依据:Google《Introducing Gemini 3.5 Transcribe》(2026年8月26日)https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
  • Google AI 文档《Gemini Live API》https://ai.google.dev/gemini-api/docs/live

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手