Simon Willison 开源基于 Gemini 3.8 TTS 的语音交互 Playground
开发者 Simon Willison 开源了基于 Gemini 3.8 TTS 模型的交互试验台,支持用户输入 API 密钥直接体验语音生成。
AI 深度解读
2026年9月23日,技术博主 Simon Willison 基于 Google 全新发布的 Gemini 3.8 TTS 语音模型开源了网页端交互测试工具 Playground,为开发者提供了便捷的语音合成体验路径。
- 界面支持配置 Google 最新推出的 gemini-3.8-flash-tts 与 gemini-3.8-flash-lite-tts 两款语音模型。
- 支持调用超过 2000 种预置音色,并支持基于 30 秒音频样本进行声音克隆与多角色对话合成。
- 采用自带 API 密钥(BYOK)架构,充分利用 Gemini API 开放的 CORS 策略在纯前端实现直接调用。
- 影响/看点:纯前端 Playground 的开源降低了多角色语音合成的测试门槛,意味着轻量化端到端调用能够加速语音应用的早期原型验证,其普及程度依赖于开发者对 API 成本与多语种表现的评估。
- 资料依据:
- Simon Willison 博客(2026-09-23):https://simonwillison.net/2026/Sep/23/gemini-tts-playground/
- Google 官方博客(2026-09-23):https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
本内容由 AI 生成,仅供参考,请注意甄别