通义千问发布Qwen-Audio-3.0-ASR-Flash语音识别模型

📡 通义千问 / Qwen2026-07-31 16:45

阿里通义千问发布语音识别模型Qwen-Audio-3.0-ASR-Flash,医疗术语识别率达95.36%。

AI 深度解读

阿里通义千问发布新一代语音识别模型Qwen-Audio-3.0-ASR-Flash,主打上下文一致性和垂直领域术语识别能力升级,内部测试显示医学、工业等专业术语的识别准确率明显提升。

  • 上下文与术语双重优化:官方列出的升级点包括上下文一致性、领域术语识别、自定义热词,以及把语音直接“润色”成结构化转录文本,面向的是专业场景而非日常闲聊转写
  • 实测数据亮眼:内部测试中医学术语召回率达到95.36%,工业术语召回率达到93.24%,这类垂直术语一直是通用ASR模型的薄弱环节
  • 三个细分版本同步发布:除基础版Flash外,还有面向实时场景的Streaming版和面向批量文件转写的Filetrans版,覆盖不同接入方式
  • 目前只开放云端API:三个版本都通过阿里云文档发布,评论区有用户询问是否会开源,但官方暂未回应,通义系列近期的开源重心似乎更多放在文本模型上
  • 对需要处理会议记录、医疗问诊、工业质检等场景语音转写的团队,这次升级的术语识别提升是实用性较强的更新,但能否落地本地化部署还要看后续开源计划。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com