接力:轨迹中继的在线策略蒸馏
提出接力式在线策略蒸馏,教师模型在检测到学生偏离时接管纠正,提升蒸馏效果。
AI 深度解读
Relay-OPD通过检测学生轨迹中的关键失败点并让教师暂时接管,大幅提升在线策略蒸馏的效果,同时减少计算浪费。
- 问题识别:在线策略蒸馏中,学生一旦走上错误推理路径,后续生成会持续偏离,导致监督信号不可靠。
- 解决方案:在训练中,当检测到前缀失败时,教师短暂接管生成“教师段”,学生随后继续并优化整个轨迹。
- 预算控制:有限的接管预算集中于关键早期位置,最小化对学生策略的偏离。
- 实验结果:在Qwen3-4B教师与0.6B/1.7B学生上,Relay-OPD在8个数学推理基准上均取得最佳或次佳,平均超越标准OPD +5.73%,训练轨迹长度减半。
- 看点:该方法为轻量级学生模型从强教师高效学习提供了实用方案,有望拓展至更多推理密集型任务。
本内容由 AI 生成,仅供参考,请注意甄别