Meta新论文:强化学习优化代码为何常失败

📡 Rohan Paul2026-08-01 12:38

Meta新论文指出RL优化代码常因测试/沙箱/奖励信号缺陷失效,改进后Qwen2.5-7B速度达标率大幅提升。

AI 深度解读

Meta发表新论文指出,用强化学习优化代码性能远比想象中复杂,单纯奖励「更快更正确」的做法通常会失效,团队通过重建整条反馈链路才拿到实质性提升。

  • 论文指出运行时信号嘈杂且稀疏,测试用例、沙箱环境、奖励设计或GRPO算法中的微小缺陷都会损害训练效果
  • 研究团队重建了整个反馈路径,包括扩大优化测试规模、校准远程执行服务
  • 引入按问题做相对排名、以正确性作为奖励门控等机制,避免模型钻速度指标的空子
  • 对GRPO算法本身做了改进,以提升面对噪声批次时的训练稳定性
  • 实测显示Qwen 2.5 7B在top-50%速度阈值下的达标率从18.0%提升至31.3%
  • 这项工作提醒行业,代码类强化学习的工程细节往往比算法设计本身更决定成败,对做智能体编码训练的团队有直接参考价值。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com