阿里通义实验室发布Qwen-Audio-3.0-TTS:支持16种语言的文本转语音模型

📡 MarkTechPost2026-07-21 05:14

阿里通义实验室发布Qwen-Audio-3.0-TTS,支持16种语言,分Flash和Plus版本。

AI 深度解读

阿里通义实验室发布Qwen-Audio-3.0-TTS,支持16种语言的文本转语音模型,提供Flash和Plus两个版本。

  • Flash版本针对实时交互,首包延迟约300毫秒;Plus版本追求高质量生成,在自然度和音色保真度上更优。
  • 模型采用12.5Hz低帧率语音分词器,降低自回归解码成本;五阶段渐进训练范式提升内容一致性和韵律自然度。
  • 支持最长3分钟的一次性合成,以及语音克隆、声音设计、指令控制等功能。
  • 输出格式包括PCM、WAV、MP3、Opus,最高48kHz采样率,通过WebSocket流式协议调用。
  • Plus版本在独立评测中排名第一,覆盖阿拉伯语、中文、英语等16种语言。
  • 影响/看点:Qwen-Audio-3.0-TTS在实时性和质量上取得平衡,多语言支持将推动AI语音助手全球化。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com