阿里Qwen-Audio-3.0-TTS登顶全球权威榜单,AI语音进入“表演时代”
阿里Qwen-Audio-3.0-TTS语音模型登顶全球权威榜单,支持细粒度标签和20种方言。
AI 深度解读
阿里 Qwen-Audio-3.0-TTS 登顶全球权威榜单,标志着 AI 语音进入“表演时代”,合成语音从机械朗读进化为情感丰富的表达。
- 细粒度标签控制允许在文本中嵌入 [gasp]、[giggles] 等标记,精确到字级别的语气调控。
- 覆盖 16 种语言和 20 种方言,通过方言强化训练避免“普通话腔”,在马来语、西班牙语等语种上领先幅度显著。
- 语音克隆能力突破噪声限制,在真实声学仿真训练下,即使高混响环境也能提取纯净音色。
- 输出提升至 48kHz,单次合成 3 分钟,Plus 版在 Artificial Analysis 榜单夺冠,Flash 版也表现优异。
- 影响/看点:该模型将语音合成从工具升级为“表演者”,为内容创作、多语种服务提供强大支持,可能推动 AI 语音在影视、教育等领域的深度应用。
本内容由 AI 生成,仅供参考,请注意甄别