Meta 发布实时音频感知模型 Muse Voice Transcribe:支持 20+ 人实时说话人分离
Meta 推出实时音频感知模型 Muse Voice Transcribe,支持流式转写与 20 人以上的实时说话人分离。
AI 深度解读
Meta Superintelligence Labs 发布实时音频感知模型 Muse Voice Transcribe,主打低延迟流式语音转写与多人并发说话人分离能力。
- 单一模型原生集成了实时流式自动语音识别、20 人以上的说话人分离以及语音端点检测能力。
- 模型具备多语言处理与句中语码混合能力,并支持通过语言指定、关键词和上下文偏置来校正识别结果。
- 官方数据显示其在 Artificial Analysis 流式语音转文本及公开说话人分离基准评测中排名前列。
- 影响/看点:单模型端到端处理多说话人流式语音可能简化会议纪要与实时交互系统的系统架构,其实际体验取决于在重叠发音与高噪音环境下的分词与分离鲁棒性。
- 资料依据:
- X:AI at Meta (@AIatMeta)(2026-09-01):https://x.com/AIatMeta/status/2094839236016976028
本内容由 AI 生成,仅供参考,请注意甄别