针对 GRPO 难题训练困境,研究者提出 Never Give Up 强化学习采样优化方法
研究者提出Never Give Up采样优化方法,通过在GRPO全错批次中继续采样来提升大模型攻克难题的效果。
AI 深度解读
AI 研究人员 Nathan Lambert 于 2026 年 9 月 15 日公布针对 GRPO 强化学习在难题训练中梯度消失问题的改进方案 “Never Give Up”,为大语言模型复杂推理能力训练提供了自适应采样的优化思路。
- GRPO 在组内采样结果全错时因无对比信号而产生零梯度,导致强化学习算力易偏向简单样本,形成马太效应。
- “Never Give Up” 机制设定在组内全部答错时以约 0.9 的概率触发追加采样,直到获得非零梯度批次。
- 方案引入异步强化学习架构,通过动态分配生成算力的方式优先攻坚高难度任务。
- 影响/看点:该方法可能改善推理模型在数学与代码高难题目上的训练收敛效率,但其收益取决于额外采样带来的计算开销与梯度方差控制水平。
- 资料依据:
- X:Nathan Lambert(2026-09-15):https://x.com/natolambert/status/2099934317753286776
- arXiv 预印本论文(2026-09-15):https://arxiv.org/abs/2609.09823
本内容由 AI 生成,仅供参考,请注意甄别