最新论文:面向 Coding Agent Harness 架构设计的实证研究
最新研究论文针对编码智能体Harness的架构设计展开实证分析,探讨如何提升智能体代码任务执行效率。
AI 深度解读
研究人员于 2026 年 9 月 17 日在 arXiv 发布论文,系统评估了连接大模型与开发环境的 Harness 架构设计对编码智能体(Coding Agent)性能的实际影响。
- 研究在 SWE-Bench Verified 和 Terminal-Bench 2.1 上对 4 种模型与 176 种 Harness 配置展开实证,将系统拆解为规划(Planning)、动作空间(Action Space)与上下文管理(Context Management)三大模块。
- 上下文管理在预算受限时至关重要,基于规则的信息精简配合 LLM 摘要效果最优,而让精简内容保持可逆恢复并未提升准确率,反而增加了系统复杂度。
- 规划机制对高能力模型主要起到降低调用开销的作用,而对低能力模型则是必不可少的准确率支架;具备优秀 Bash 能力的模型直接使用 Bash 接口即可保持高效与低成本。
- 影响/看点:该实证表明编码智能体不存在通用的最优架构,开发者需要根据底层模型的基础能力与上下文预算定制 Harness,盲目堆叠复杂控制层可能带来负向收益。
- 资料依据:
- arXiv(2026-09-17):https://arxiv.org/abs/2609.20804
- X:AK(2026-09-18):https://x.com/_akhaliq/status/2101020560964866103
本内容由 AI 生成,仅供参考,请注意甄别