苹果发布半监督联邦语音识别实用方案:在线伪标签与服务端稳定更新机制
苹果提出半监督联邦语音识别新方案,通过在线伪标签与服务端稳定更新机制,大幅缩小与全监督训练的差距。
AI 深度解读
苹果机器学习研究团队发布半监督联邦语音识别(ASR)方案,针对端侧无标注数据训练中易出现的伪标签误差累积与模型发散问题给出了系统性解法。
- 研究提出耦合教师(Teacher)与锚点(Anchor)的双轴架构:在客户端利用持续演化的在线模型生成伪标签,在服务端利用有标注种子数据持续更新以稳定训练。
- 引入了从全局教师向在线教师渐进切换的过渡机制(Transitioning Teacher),以兼顾训练初期的全局稳定性与后期的域内适应能力。
- 实验结果表明,该方案在 11 组测试中有 9 组优于此前最强方法,域内准确率平均提升 20.8%,跨域准确率平均提升 10.0%,有效缩小了半监督与全监督联邦学习的性能差距。
- 影响/看点:该成果意味着在严格保护用户端侧语音隐私的前提下,利用海量设备端未标注数据持续迭代语音模型具有更强可行性,其推广前提是端侧硬件算力与网络带宽能够承受频繁的在线伪标签推理与模型同步开销。
- 资料依据:
- Apple Machine Learning Research(2026-09-24):https://machinelearning.apple.com/research/practical-recipe-federated-asr
本内容由 AI 生成,仅供参考,请注意甄别