Simon Willison 开源基于 Gemini 3.8 TTS 的语音交互 Playground

📡 Simon Willison 博客2026-09-24 01:12

开发者 Simon Willison 开源了基于 Gemini 3.8 TTS 模型的交互试验台,支持用户输入 API 密钥直接体验语音生成。

AI 深度解读

2026年9月23日,技术博主 Simon Willison 基于 Google 全新发布的 Gemini 3.8 TTS 语音模型开源了网页端交互测试工具 Playground,为开发者提供了便捷的语音合成体验路径。

  • 界面支持配置 Google 最新推出的 gemini-3.8-flash-tts 与 gemini-3.8-flash-lite-tts 两款语音模型。
  • 支持调用超过 2000 种预置音色,并支持基于 30 秒音频样本进行声音克隆与多角色对话合成。
  • 采用自带 API 密钥(BYOK)架构,充分利用 Gemini API 开放的 CORS 策略在纯前端实现直接调用。
  • 影响/看点:纯前端 Playground 的开源降低了多角色语音合成的测试门槛,意味着轻量化端到端调用能够加速语音应用的早期原型验证,其普及程度依赖于开发者对 API 成本与多语种表现的评估。
  • 资料依据:
  • Simon Willison 博客(2026-09-23):https://simonwillison.net/2026/Sep/23/gemini-tts-playground/
  • Google 官方博客(2026-09-23):https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手