代码智能体 Harness 设计实证研究:解构规划、动作空间与上下文管理

📡 HuggingFace Daily Papers2026-09-17 08:00

研究团队系统评估了代码智能体Harness中规划、动作空间与上下文管理对长程软件工程任务性能的影响。

AI 深度解读

研究团队在 arXiv 发表关于代码智能体 Harness 设计的实证研究,系统拆解了规划、动作空间与上下文管理对智能体软件工程任务性能的具体影响。

  • 实验规模与基准:在 SWE-Bench Verified 和 Terminal-Bench 2.1 上针对 4 款模型评估了 176 组匹配配置,覆盖 5 种上下文策略与 4 种窗口预算。
  • 上下文策略取舍:上下文管理的核心收益在于防止溢出失败;先规则过滤、后大模型总结的策略效率最高,而支持恢复被省略内容的设计未带来准确率增益。
  • 规划与动作空间分化:规划机制能提升弱模型的准确率,但在强模型上主要体现为减少调用成本;具备 Bash 能力的模型直接使用命令行接口比预定义工具更具成本优势。
  • 影响/看点:该研究为智能体工程提供了细粒度的组件选型依据,意味着未来的代码智能体可以根据底层模型基座能力和算力预算进行差异化架构设计。
  • 资料依据:
  • arXiv 论文库(2026-09-17):https://arxiv.org/abs/2609.20804
  • HuggingFace Daily Papers(2026-09-17):https://huggingface.co/papers/2609.20804

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手