ElevenLabs 推出 v4 与 v4 Turbo 语音模型:支持 90+ 种语言与 10 秒声音克隆
ElevenLabs 推出 v4 及 v4 Turbo 语音模型,支持 10 秒快速克隆声音与 90 余种语言,并针对语音智能体降低了延迟。
AI 深度解读
语音 AI 初创企业 ElevenLabs 于 2026 年 9 月 28 日发布 v4 与 v4 Turbo 语音合成模型,在克隆门槛、多语言覆盖及实时交互延迟上的改进体现了语音智能体基础设施的迭代趋势。
- 据 IT之家 与 ElevenLabs 官方 2026 年 9 月 28 日介绍,v4 模型将声音克隆所需音频素材缩短至 10 秒,并支持叠加多个内联情绪标签按序执行。
- 支持语言数量由上一代的 70 种扩展至 90 余种,并优化了大段文本朗读时的音色一致性与上下文语气理解。
- 新模型针对企业语音智能体场景进行了低延迟优化,可在后端大语言模型刚开始输出 Token 时同步生成音频,并针对客诉升级、争执与等待场景提供差异化交互处理。
- 商业数据方面,官方披露其超过 55% 的收入来自大型企业,年化营收运行速率突破 6 亿美元。
- 影响/看点:低延迟与短素材克隆能力的结合意味着企业端智能客服和实时双向语音助手的部署门槛可能进一步降低,但跨语言发音的自然度与合成音频防伪安全仍需在规模化落地中持续检验。
- 资料依据:
- ElevenLabs(2026-09-28):https://elevenlabs.io/blog/eleven-v4
- IT之家(2026-09-28):https://www.ithome.com/1/008/080.htm
本内容由 AI 生成,仅供参考,请注意甄别