谷歌推出 Gemini 3.8 Flash TTS:支持提示词自创声音与音色克隆

📡 The Decoder2026-09-24 01:39

谷歌发布 Gemini 3.8 Flash TTS 模型,支持通过文字描述自创声音及短音频音色克隆。

AI 深度解读

谷歌推出 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音合成模型,支持超过 100 种语言,并支持利用文本提示词直接生成全新音色及 30 秒样本音色克隆,为语音生成提供了更高的定制灵活性。

  • 文本提示词生成音色:开发者可通过自然语言描述声音属性直接生成全新音色,减少了对固定语音库的依赖。
  • 支持台词舞台指令与双人对白:模型允许在脚本中加入情绪与语气等舞台指示,并可单文本直接输出双角色对话音频。
  • 低样本音色克隆与多语种覆盖:系统支持基于 30 秒音频样本构建音色档案,并在 100 多种语言环境中保持支持。
  • 影响/看点:新模型意味着开发者与创作者能够以更低成本定制多样化的多语种语音资产;其实际商用落地仍需依托有效的防伪鉴别与声音版权保护机制。
  • 资料依据:
  • The Decoder(2026-09-23):https://the-decoder.com/googles-new-flash-tts-models-let-you-design-ai-voices-from-scratch-using-text-descriptions/
  • Google Cloud 官方文档(2026-09-23):https://cloud.google.com/vertex-ai/generative-ai/docs/tts/gemini-flash-tts

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手