阿里Qwen-Audio-3.0-TTS登顶全球权威榜单,AI语音进入“表演时代”

📡 量子位 资讯2026-07-20 17:05

阿里Qwen-Audio-3.0-TTS语音模型登顶全球权威榜单,支持细粒度标签和20种方言。

AI 深度解读

阿里 Qwen-Audio-3.0-TTS 登顶全球权威榜单,标志着 AI 语音进入“表演时代”,合成语音从机械朗读进化为情感丰富的表达。

  • 细粒度标签控制允许在文本中嵌入 [gasp]、[giggles] 等标记,精确到字级别的语气调控。
  • 覆盖 16 种语言和 20 种方言,通过方言强化训练避免“普通话腔”,在马来语、西班牙语等语种上领先幅度显著。
  • 语音克隆能力突破噪声限制,在真实声学仿真训练下,即使高混响环境也能提取纯净音色。
  • 输出提升至 48kHz,单次合成 3 分钟,Plus 版在 Artificial Analysis 榜单夺冠,Flash 版也表现优异。
  • 影响/看点:该模型将语音合成从工具升级为“表演者”,为内容创作、多语种服务提供强大支持,可能推动 AI 语音在影视、教育等领域的深度应用。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com