阿里千问发布 Qwen-Audio-3.1 全家桶:五款模型覆盖理解生成交互并大幅降价

📡 通义千问 / Qwen2026-09-23 17:11

阿里千问发布 Qwen-Audio-3.1 系列共五款音频模型,覆盖语音识别、合成与实时交互,并大幅下调接口价格。

AI 深度解读

阿里巴巴千问团队于 2026 年 9 月 23 日发布 Qwen-Audio-3.1 系列音频模型,覆盖理解、生成、交互与创作四个方向并下调调用资费,为实时语音应用提供了更低成本的基础设施选择。

  • 该系列共包含五款模型,对原有的 ASR(语音识别)、TTS(语音合成)与 Realtime(实时交互)模型进行了升级,并新增音频创作模型 TTS-Next 和音频理解模型 ASR-Next。
  • 官方同步下调 API 价格,TTS 服务降价约 70%,Realtime 服务降价约 85%,ASR 服务降价幅度最高达 95%。
  • Realtime 模型支持全双工实时流式交互,具备边听边说与即时打断能力,并在识别到用户低落情绪时能够降低语速进行共情回应。
  • 影响/看点:这可能降低实时语音助手与端到端对话应用的研发与推理成本,但其实际效果仍取决于在弱网和嘈杂环境下的端到端延迟与抗噪稳定性。
  • 资料依据:
  • X:通义千问 / Qwen(2026-09-23):https://x.com/Alibaba_Qwen/status/2102687258990026993

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手