通义千问团队提出 Elastic Horizon 算法:闭环优化智能体强化学习交互轮数

📡 DAIR.AI2026-09-11 02:00

阿里千问团队提出 Elastic Horizon 强化学习调度算法,闭环优化智能体交互轮数并减少 25% Token 消耗。

AI 深度解读

阿里巴巴通义千问团队与合作者提出 Elastic Horizon 算法,针对智能体强化学习中交互轮数开环设定的局限,建立了自适应确定交互预算的闭环控制方法。

  • 研究团队提出了「有效交互前沿」假说,指出智能体与环境交互的轮数存在边际收益递减的动态边界,盲目增加轮数会导致 token 成本激增而任务收益停滞。
  • Elastic Horizon 通过闭环追踪成功轨迹长度的第 90 分位数,动态调整每轮训练的允许交互上限,使交互预算稳定在性能饱和区间内。
  • 在 AppWorld 和 BFCL 评测基准上,该方法在 7B 和 14B 参数模型中均取得最优成功率,并将每步轨迹 token 消耗减少了最高 25%。
  • 影响/看点:这一方法将智能体训练的关注点从单纯延长交互轮数转向识别收敛边界,若在跨领域多智能体长任务中验证有效,可能显著压缩具身与工具调用智能体的训练计算开销。
  • 资料依据:
  • arXiv 论文预印本(2026-09-08):https://arxiv.org/abs/2609.07247
  • DAIR.AI 官方 X 帖子(2026-09-10):https://x.com/dair_ai/status/2098109386568925397

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手