AREX:面向深度研究的递归自我改进智能体

📡 HuggingFace Daily Papers2026-07-23 08:00

论文提出AREX,通过内层研究循环与外层自我审计循环递归验证并改进候选答案的深度研究智能体。

AI 深度解读

一篇 arXiv 论文提出 AREX,一种面向深度研究任务的递归自我改进智能体,核心洞察是发现答案的成本远高于验证答案的成本,因此与其一味搜索更久,不如让智能体反复验证已有结论、再据此发起针对性的补充调查。

  • 架构分内外两层循环:内层负责收集证据、构建阶段性答案,外层负责按约束逐项审计答案、找出尚未验证的论断,并发起针对性的后续研究
  • 为支撑长时程的递归自我改进,团队训练了一个自主的上下文更新工具,把不断增长的交互历史压缩成保留已验证证据和未解决约束的精简状态,且不依赖外部模型
  • 训练路径是先在可验证的合成任务和高质量轨迹上做智能体中期训练,再叠加长时程强化学习
  • 针对长时程学习中奖励稀疏的问题,训练时特别强化了“获得关键决定性证据”或“纠正错误研究方向”这类关键节点
  • 团队落地了 4B 稠密模型和 122B-A10B 混合专家模型两种规格,并在 BrowseComp、WideSearch、DeepSearchQA、Humanity's Last Exam 等多个基准上做了验证
  • 论文给出的结果是,即便激活参数远少于对比模型,AREX 在这些基准上依然保持有竞争力的表现,说明“递归验证驱动改进”可能是比单纯扩大搜索规模更高效的深度研究范式。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com