Meta 推出首个实时音频感知模型 Muse Voice Transcribe,支持 20 余人分轨转写
Meta 发布实时音频模型 Muse Voice Transcribe,支持流式识别与 20 余人的多人分轨转写。
AI 深度解读
Meta 推出首个实时音频感知模型 Muse Voice Transcribe 并开放 API 调用,展示了流式语音识别与多人分轨一体化处理的技术进展。
- 在单套流程中整合流式语音识别、说话人分离与语音端点检测,支持在包含 20 余人的多发言者场景下实时输出文字。
- 引入自适应延迟机制,针对不同发音清晰度和语境复杂度动态调整上下文采样窗口,以平衡响应速度与准确率。
- 模型覆盖 70 余种语言并完成 25 种语言的验证,支持超过 1 小时的长音频以及句内语言混合切换,并提供上下文词汇偏置接口。
- 开发者调用定价为每 1000 分钟音频 3 美元(折合每小时约 0.18 美元),并在第三方流式转写基准测试中取得前列成绩。
- 影响/看点:该模型若能在实际多人多语种会议场景中保持标称的低延迟与高分离精度,可能降低实时字幕与智能会议记录工具的集成门槛与部署成本。
- 资料依据:
- IT之家(2026-09-02):https://www.ithome.com/0/997/218.htm
- Alexandr Wang 个人 X 账号(2026-09-01):https://x.com/alexandr_wang/status/2094869215669035274
本内容由 AI 生成,仅供参考,请注意甄别