SLPO:通过代理策略扩展潜在推理
提出SLPO方法,通过代理策略优化潜在推理,使模型在固定思考预算下实现测试时扩展,超越显式思维链。
AI 深度解读
本文提出代理潜在策略优化(SLPO),将基于结果奖励的强化学习引入自回归潜在推理器,解决潜在轨迹缺乏逐步骤似然和自适应停止接口的问题,从而实现在连续和软思考设置下的测试时扩展。
- 显式思维链推理通过结果奖励 RL 实现测试时扩展,但每个中间步骤需解码为语言 token,计算成本高。
- 潜在推理将中间计算作为连续向量,在更短推理长度下匹配或超越显式 CoT,但受限于模仿学习。
- 潜在轨迹缺乏可处理的逐步骤似然和固定思考预算下的自适应停止接口,导致结果奖励无法激发测试时扩展。
- SLPO 引入代理策略密度用于轨迹级信用分配,以及正确性监督的停止头,通过结果奖励优化为可变长度策略。
- 在连续和软思考设置下,SLPO 提升了并行采样下的 Pass@k,并为更难的实例分配更长的潜在计算,同时保持较高的确定性准确率。
- 影响/看点:SLPO 弥合了潜在推理与结果奖励 RL 之间的鸿沟,为潜在推理器提供了可扩展的强化学习框架,有望在降低计算成本的同时提升复杂推理能力。
本内容由 AI 生成,仅供参考,请注意甄别