阿里千问发布语音合成大模型 Qwen-Audio-3.0-TTS,登顶 Artificial Analysis 榜首

📡 IT之家2026-07-20 16:55

阿里千问发布语音合成大模型Qwen-Audio-3.0-TTS,登顶Artificial Analysis榜首,支持细粒度情感控制。

AI 深度解读

阿里千问发布 Qwen-Audio-3.0-TTS,在语音合成领域实现从“能说话”到“会表达”的跨越,登顶 Artificial Analysis 榜首。

  • 模型提供 Flash(首包延时 300ms)和 Plus 两个版本,分别面向实时交互和高质量生成。
  • 支持结构化标签,如 [gasp]、[giggles]、[angry],可精确控制语气、情绪和呼吸细节。
  • 覆盖 16 种语言和 20 种方言,在 CV3-Eval 多语种测试中,10 种语言词错误率最优,Plus 版说话人相似度全胜。
  • 音频输出提升至 48kHz,单次合成可达 3 分钟,并配备精品音色库,支持噪声环境下的语音克隆。
  • 影响/看点:该模型将语音合成带入“表演时代”,为游戏、配音、客服等场景提供前所未有的细腻表达,有望加速 AI 语音在创意产业的落地。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com