微软 AI 正式发布高速低成本语音转录模型 MAI-Transcribe-2
微软发布低成本语音转写模型 MAI-Transcribe-2,具备高准确率与更快的转写速度。
AI 深度解读
微软 AI 首席执行官 Mustafa Suleyman 于 2026 年 9 月 3 日宣布推出自研语音转录模型 MAI-Transcribe-2,主打高速率与低调用成本,受到语音识别与会议记录开发领域的关注。
- 官方宣称该模型在转录速度上达到 GPT-Transcribe 的 10 倍、Gemini 3.5 的 5 倍,并在 Artificial Analysis 的准确率与延迟综合评估中位列前列。
- 模型支持多说话人分离、词级别时间戳、专有名词关键词偏置,并提供严格逐字与文本清洗两种转录输出模式。
- 定价定为每小时音频 0.10 美元,目前已在微软 Foundry 与测试平台开放预览,旨在降低大规模语音转写的调用成本。
- 影响/看点:该模型意味着微软正在加速将 Teams 会议与医疗听写等底层语音负载迁移至自研模型以降低对外部模型的依赖,其实际市场竞争力仍需第三方独立长音频测试与多语言噪音环境验证。
- 资料依据:
- X:Mustafa Suleyman(2026-09-03):https://x.com/mustafasuleyman/status/2095521337670312056
- Microsoft AI 官方发布(2026-09-03):https://www.microsoft.ai/news/mai-transcribe-2-speech-to-text/
本内容由 AI 生成,仅供参考,请注意甄别