阿里千问发布语音合成大模型 Qwen-Audio-3.0-TTS,登顶 Artificial Analysis 榜首
阿里千问发布语音合成大模型Qwen-Audio-3.0-TTS,登顶Artificial Analysis榜首,支持细粒度情感控制。
AI 深度解读
阿里千问发布 Qwen-Audio-3.0-TTS,在语音合成领域实现从“能说话”到“会表达”的跨越,登顶 Artificial Analysis 榜首。
- 模型提供 Flash(首包延时 300ms)和 Plus 两个版本,分别面向实时交互和高质量生成。
- 支持结构化标签,如 [gasp]、[giggles]、[angry],可精确控制语气、情绪和呼吸细节。
- 覆盖 16 种语言和 20 种方言,在 CV3-Eval 多语种测试中,10 种语言词错误率最优,Plus 版说话人相似度全胜。
- 音频输出提升至 48kHz,单次合成可达 3 分钟,并配备精品音色库,支持噪声环境下的语音克隆。
- 影响/看点:该模型将语音合成带入“表演时代”,为游戏、配音、客服等场景提供前所未有的细腻表达,有望加速 AI 语音在创意产业的落地。
本内容由 AI 生成,仅供参考,请注意甄别