基于同策略反向蒸馏激发弱到强泛化能力(OPRD)
针对弱监督导致强模型能力受限的问题,提出同策略反向蒸馏(OPRD),利用验证器引导策略更新,实现弱到强的模型泛化。
AI 深度解读
针对强模型向弱模型学习容易受限于教师模型能力上限的瓶颈, 论文提出基于同策略反向蒸馏(OPRD)的新型弱到强泛化优化方法。
- 梯度方向重标定机制:OPRD 不将弱教师模型作为直接拟合目标, 而是计算教师策略相对其参考策略的偏移, 仅放大具有验证器支持的梯度分量。
- 保留策略优化不动点:通过仅重标定验证器支持的更新方向, 在借助教师先验加速学生收敛的同时, 确保不破坏学生模型自身的理论最优解。
- 减少强化学习更新步数:在多代模型迁移与多教师蒸馏实验中, OPRD 相比传统强化学习和传统蒸馏方法均以更少的更新步数取得了更高分数。
- 保持学生独立推理风格:响应风格分析显示, OPRD 训练出的学生模型输出特征更接近纯验证器强化学习模型, 表明弱教师起到了搜索加速而非强制同化的作用。
- 影响/看点:该方法意味着大模型迭代训练可能不再完全依赖代价高昂的强监督信号, 若在更广泛的任务领域得到验证, 将有助于降低前沿模型后训练与跨领域迁移的计算开销。
- 资料依据:
- arXiv 预印本平台(2026-09-08):https://arxiv.org/abs/2609.08798
- Hugging Face 论文精选(2026-09-08):https://huggingface.co/papers/2609.08798
本内容由 AI 生成,仅供参考,请注意甄别