Meta新论文:强化学习优化代码为何常失败
Meta新论文指出RL优化代码常因测试/沙箱/奖励信号缺陷失效,改进后Qwen2.5-7B速度达标率大幅提升。
AI 深度解读
Meta发表新论文指出,用强化学习优化代码性能远比想象中复杂,单纯奖励「更快更正确」的做法通常会失效,团队通过重建整条反馈链路才拿到实质性提升。
- 论文指出运行时信号嘈杂且稀疏,测试用例、沙箱环境、奖励设计或GRPO算法中的微小缺陷都会损害训练效果
- 研究团队重建了整个反馈路径,包括扩大优化测试规模、校准远程执行服务
- 引入按问题做相对排名、以正确性作为奖励门控等机制,避免模型钻速度指标的空子
- 对GRPO算法本身做了改进,以提升面对噪声批次时的训练稳定性
- 实测显示Qwen 2.5 7B在top-50%速度阈值下的达标率从18.0%提升至31.3%
- 这项工作提醒行业,代码类强化学习的工程细节往往比算法设计本身更决定成败,对做智能体编码训练的团队有直接参考价值。
本内容由 AI 生成,仅供参考,请注意甄别