阿里千问发布 Qwen-Audio-3.1 语音大模型全家桶,全线降价最高达 95%
阿里千问发布 Qwen-Audio-3.1 系列语音大模型,全面升级音频能力栈,并下调全线模型价格,最高降幅达 95%。
AI 深度解读
阿里千问发布 Qwen-Audio-3.1 系列音频大模型并下调全线调用资费,旨在通过端到端多模态处理降低语音识别与音频交互的工业落地成本。
- 本次发布覆盖 ASR、TTS、Realtime 以及全新的音频创作模型 TTS-Next 与音频理解模型 ASR-Next 等五款模型,形成完整音频处理栈。
- 全线 API 价格进行了阶梯下调,其中 TTS 服务降价约 70%,Realtime 降价约 85%,ASR 识别服务降幅达 95%。
- Qwen-Audio-3.1-ASR 支持 30 种语言与 16 种中文方言,首字响应延迟约为 160 毫秒,具备原生语气词去除、语义重组与多说话人分角色时间戳输出能力。
- 在公开基准 KeSpeech 与 WSYue 的 11 个子集评测中,ASR 平均字错误率为 4.55%;在 16 种中文方言自建测试集中平均字错误率为 10.38%。
- 影响/看点:调用资费的下调与低延迟分角色转写能力的提升,可能加速多语种会议纪要与实时客服智能体的规模化应用,前提是高噪声及方言重叠环境下的转写准确率能满足工业交付标准。
- 资料依据:
- IT之家(2026-09-23):https://www.ithome.com/1/006/280.htm
- GitHub官方仓库(2026-09-23):https://github.com/QwenLM/Qwen
本内容由 AI 生成,仅供参考,请注意甄别