接力:轨迹中继的在线策略蒸馏

📡 HuggingFace Daily Papers2026-07-28 08:00

提出接力式在线策略蒸馏,教师模型在检测到学生偏离时接管纠正,提升蒸馏效果。

AI 深度解读

Relay-OPD通过检测学生轨迹中的关键失败点并让教师暂时接管,大幅提升在线策略蒸馏的效果,同时减少计算浪费。

  • 问题识别:在线策略蒸馏中,学生一旦走上错误推理路径,后续生成会持续偏离,导致监督信号不可靠。
  • 解决方案:在训练中,当检测到前缀失败时,教师短暂接管生成“教师段”,学生随后继续并优化整个轨迹。
  • 预算控制:有限的接管预算集中于关键早期位置,最小化对学生策略的偏离。
  • 实验结果:在Qwen3-4B教师与0.6B/1.7B学生上,Relay-OPD在8个数学推理基准上均取得最佳或次佳,平均超越标准OPD +5.73%,训练轨迹长度减半。
  • 看点:该方法为轻量级学生模型从强教师高效学习提供了实用方案,有望拓展至更多推理密集型任务。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com