DeepMind 官方博客:Gemini 3.8 文本转语音模型正式上线
Google DeepMind 宣布正式上线 Gemini 3.8 文本转语音(TTS)模型。
AI 深度解读
Google DeepMind 于 2026 年 9 月 23 日发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,展示了多模态大模型在精细化音频生成与角色化定制方面的工程化落地。
- Flash TTS 主打游戏、有声书及角色设计等场景,支持逐行控制表演节奏、语气与方言转换。
- Flash-Lite TTS 聚焦高吞吐量与成本效益,适用于批量配音与低延迟语音助手。
- 支持通过自然语言提示词定制涵盖 100 多种语言及方言的声音,内置 2000 多个预设声音。
- 提供 30 秒音频声音复刻功能,并集成 SynthID 数字水印与 C2PA 凭证认证以确保合规。
- 影响/看点:该系列模型可能降低长音频与互动媒体的制作门槛,但其大规模落地效果仍取决于跨语种自然度控制以及深度伪造防范机制的实际表现。
- 资料依据:
- Google DeepMind Blog(2026-09-23):https://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
本内容由 AI 生成,仅供参考,请注意甄别