RobustSGPO:引入搜索空间控制以优化智能体自动化评估与提示词进化
论文提出 RobustSGPO 算法,通过引入搜索空间控制,显著优化智能体 Harness 与提示词的自动进化效果。
AI 深度解读
研究人员于 2026 年 9 月 9 日发布预印本论文 RobustSGPO,针对智能体框架自动进化中的搜索空间失控问题提出控制机制,为提升提示词与工作流优化稳定性提供了新方案。
- 该研究基于语义梯度提示优化(SGPO)框架,针对原有局部更新规则中编辑范围与操作随意、容易丢失有效配置的缺陷进行改进。
- 引入显式搜索空间控制机制,通过明确请求编辑内容、在合并修改前构建并验证补丁有效性,并支持从当前方案或历史快照继续搜索。
- 在 AgentX 头脑风暴工作流测试中,基于 120 项任务与 7350 次尝试的评估显示,30 项保留测试集的任务完成率由 60.0% 提升至 80.0%,测试质量由 3.77 升至 4.14(在 2000 万 token 预算限制下)。
- 影响/看点:若该机制在复杂软件工程等更多实际智能体任务中保持鲁棒性,搜索空间控制有望提高自动化提示词调优的收敛效率,但其收益仍受限于语义梯度评估器本身的准确度和计算开销。
- 资料依据:
- arXiv 论文预印本(2026-09-09):https://arxiv.org/abs/2609.09646
- DAIR.AI(2026-09-10):https://x.com/dair_ai/status/2098067735389593926
本内容由 AI 生成,仅供参考,请注意甄别