阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别大模型,专业词汇识别更准

📡 IT之家2026-07-31 11:57

阿里发布语音识别模型Qwen-Audio-3.0-ASR-Flash,主攻专业术语识别,医疗场景听中率达95.36%。

AI 深度解读

阿里巴巴上线语音识别大模型 Qwen-Audio-3.0-ASR-Flash,核心卖点是让 AI 更准确地听懂医疗、IT、股票等专业领域的术语和冷门词,而不只是识别日常对话。

  • 系统性优化了上下文一致性、行业词识别和热词定制化三个维度,并具备语音润色能力,可直接输出结构化文本
  • 团队持续从医疗、IT 编程、股票、社会名人等领域构建专业词库,专门强化冷门术语的识别准确率
  • 内部评测显示医疗场景专业词“听中率”突破 95.36%,行业词汇识别有明显提升
  • 在 Artificial Analysis 平台的评测中以 1.7% 错字率拿下全球第一,说明整体识别精度也处于头部水平
  • 已通过阿里云百炼平台开放调用,提供 Flash(最长 5 分钟)、Filetrans(离线文件转写)、Streaming(实时识别)三个版本,已在会议纪要、字幕、录播、客服等场景验证
  • 看点在于:通用语音识别的“最后一公里”问题正在被专业词库和垂直优化解决,对医疗、金融等强术语依赖行业的语音转写和智能客服落地是直接利好。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com