谷歌发布 Gemini 3.8 Flash TTS 及 Flash-Lite TTS 语音合成模型
谷歌发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 语音模型,支持 100 多种语言声音定制与超 2000 款预置声音。
AI 深度解读
Google AI 于 2026 年 9 月 23 日发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 语音模型,重点优化了细粒度交互标记控制与长时间音频生成的稳定性。
- 支持在文本中嵌入笑声与语气词等副语言控制标记,提升对话交互的拟真感。
- Flash TTS 针对高保真内容制作提供逐行语调与节奏微调,Flash-Lite TTS 针对实时语音 Agent 优化动态调整能力。
- 覆盖 100 多种语言并提供 2000 多个即用型声音,支持长达数小时的连续稳定音频生成。
- 影响/看点:副语言交互标记的引入意味着语音智能体在实时对话中可呈现更连贯的情绪反馈,其实用价值取决于实际业务场景中的端到端延迟与算力开销。
- 资料依据:
- X:Google AI(2026-09-23):https://x.com/GoogleAI/status/2102781694730285427
- Google DeepMind Blog(2026-09-23):https://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
本内容由 AI 生成,仅供参考,请注意甄别