字节跳动 Seed 团队提出 HarnessDev:评估大模型自主编写与泛化智能体脚手架的能力
字节跳动等团队提出HarnessDev基准,专门评测大模型自主编写智能体运行脚手架并实现泛化的能力。
AI 深度解读
字节跳动 Seed 团队联合多家研究机构提出 HarnessDev 基准,首次将评估对象从模型生成的答案转向模型自主编写并演进的可运行智能体脚手架(Harness)。
- 该研究涵盖创建(Creation)与演进(Evolution)两个阶段,测试了 Opus 4.8、GPT-5.5、Gemini 3.1 Pro 等 6 款模型在 5 个基准共 2207 个任务实例上的脚手架构建表现。
- 创建阶段中,模型从无循环与规划的弱种子出发构建完整脚手架,Opus 4.8 取得 67.8 的平均分(人类参考为 86.2),其中状态与记忆管理是各模型普遍的薄弱环节。
- 演进实验表明,模型做出的 64 次脚手架修改中仅有 34 次在保留测试集上表现出同向泛化,9 个最终版本中仅 2 个达到保留集最优,揭示出智能体自我演进存在较强的过拟合与噪声波动。
- 影响/看点:HarnessDev 揭示了大模型自主构建与优化智能体框架时的泛化瓶颈,意味着实现全自动智能体自我迭代仍需更严谨的验证机制与防退化策略。
- 资料依据:
- MarkTechPost(2026-09-11):https://www.marktechpost.com/2026/09/11/can-llms-engineer-their-own-agent-harness-bytedance-seeds-harnessdev-says-only-34-of-64-changes-generalize/
- arXiv 论文预印本(2026-09-08):https://arxiv.org/abs/2609.01437
本内容由 AI 生成,仅供参考,请注意甄别