RetireOPD:面向智能体强化学习的自退役同策略蒸馏方法
论文提出RetireOPD方法,在多轮智能体强化学习中通过自适应退役机制让学生模型高效吸收教师特权技能。
AI 深度解读
arXiv 于 2026 年 9 月 17 日发布面向智能体强化学习的蒸馏方法 RetireOPD,针对多轮交互中特权教师监督收益递减与阶段性瓶颈问题提出了自适应退役机制。
- 研究发现特权信息并不必然保证教师策略始终可靠,且教师监督的正面作用存在明显的阶段性特征。
- RetireOPD 首先通过环境奖励优化解耦的技能条件教师,随后通过强化学习与同策略蒸馏联合训练无特权学生模型。
- 引入自适应退役机制,当师生策略差异收敛且学生达到预设成功率比例时自动脱离教师监督,转入纯强化学习阶段。
- 在 Qwen2.5(1.5B 至 7B)模型测试中,该方法在 ALFWorld 上相比强化学习基线提升 14.1% 至 18.8% 的成功率,在 WebShop 上提升 11.8% 至 19.0% 的准确率。
- 影响/看点:该机制为智能体训练提供了避免被次优教师策略锁定的动态解耦范式,但其增益幅度依赖于学生模型脱离教师时机判定阈值的合理设定。
- 资料依据:
- arXiv(2026-09-17):https://arxiv.org/abs/2609.20784
- HuggingFace Daily Papers(2026-09-17):https://huggingface.co/papers/2609.20784
本内容由 AI 生成,仅供参考,请注意甄别