腾讯提出智能体动态强化学习新框架:渐进增难环境显著提升代码智能体能力

📡 Rohan Paul2026-09-09 10:35

腾讯论文提出渐进增难的强化学习训练环境,有效避免任务过易导致信号失效,显著提升代码智能体表现。

AI 深度解读

腾讯研究团队于 2026 年 9 月 9 日发布代码智能体强化学习新研究,提出采用持续递增难度的动态环境替代传统的共同进化(co-evolution)机制,以解决合成任务在被智能体掌握后无法继续提供有效强化学习信号的问题。

  • 研究指出,合成终端任务随着智能体能力的提升会逐渐失去难度梯度,一旦智能体能够稳定求解,便无法产生足够的强化学习梯度信号。
  • 该方案并不等待模型出错后再针对性构造任务,而是主动推进任务环境的演进,通过逐步降低环境熟悉度、引入低频复杂操作以及增加任务执行步数来提高挑战性。
  • 在 Terminal-Bench 2.1 基准评测中,Qwen3.6-27B 模型的成功率从共同进化方案的 62.9% 提升至 71.5%,Qwen3.6-35B-A3B 从 55.1% 提升至 64.9%。
  • 论文在 Hy4 preview、Claude Opus 5 与 GPT-5.6 Sol 等多模型测试环境中验证了环境难度自适应递增的有效性。
  • 影响/看点:这一动态环境框架意味着通过环境自适应演进可改善代码智能体在长程复杂任务中的训练效率,但其实际成效依赖于高难度自动化任务生成的质量把控与防幻觉验证机制。
  • 资料依据:
  • X:Rohan Paul (@rohanpaul_ai)(2026-09-09):https://x.com/rohanpaul_ai/status/2097514312424366221
  • arXiv(2026-09-09):https://arxiv.org/abs/2609.04123

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手