阿里通义实验室发布Qwen-Audio-3.0-TTS:支持16种语言的文本转语音模型
阿里通义实验室发布Qwen-Audio-3.0-TTS,支持16种语言,分Flash和Plus版本。
AI 深度解读
阿里通义实验室发布Qwen-Audio-3.0-TTS,支持16种语言的文本转语音模型,提供Flash和Plus两个版本。
- Flash版本针对实时交互,首包延迟约300毫秒;Plus版本追求高质量生成,在自然度和音色保真度上更优。
- 模型采用12.5Hz低帧率语音分词器,降低自回归解码成本;五阶段渐进训练范式提升内容一致性和韵律自然度。
- 支持最长3分钟的一次性合成,以及语音克隆、声音设计、指令控制等功能。
- 输出格式包括PCM、WAV、MP3、Opus,最高48kHz采样率,通过WebSocket流式协议调用。
- Plus版本在独立评测中排名第一,覆盖阿拉伯语、中文、英语等16种语言。
- 影响/看点:Qwen-Audio-3.0-TTS在实时性和质量上取得平衡,多语言支持将推动AI语音助手全球化。
本内容由 AI 生成,仅供参考,请注意甄别