Zoom 实证研究:深入解析代码智能体 Harness 的核心设计权衡

📡 DAIR.AI2026-09-19 06:30

Zoom 团队在多模型基准上开展实证研究,深入分析了代码智能体 Harness 在规划与上下文等方面的设计权衡。

AI 深度解读

Zoom 与高校合作团队发布预印本论文,系统评估了编码智能体 Harness 中各项核心架构设计的效能与取舍。

  • 研究在 SWE-Bench Verified 和 Terminal-Bench 2.1 上固定执行循环,通过 176 组匹配实验系统解耦规划、动作空间与上下文管理三个维度。
  • 实验表明上下文管理在长任务和有限窗口预算下可有效抑制溢出崩溃;规划模块对能力较弱模型起精度支架作用,对强模型主要体现为降低探索成本。
  • 动作空间方面,专用结构化工具有利于 Bash 能力薄弱的模型,而熟练掌握命令行环境的高能力模型仅凭 Bash 接口即可低成本达成同等效果。
  • 影响/看点:该研究为软件工程智能体从黑盒堆叠转向组件模块化优化提供了量化实证,有助于开发者依据基座模型能力定制性价比更高的 Harness 架构。
  • 资料依据:
  • X:DAIR.AI (@dair_ai)(2026-09-18):https://x.com/dair_ai/status/2101076312857477393
  • arXiv 论文原文(2026-09-17):https://arxiv.org/abs/2609.20804

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手