上海 AI Lab 提出 Harness 自进化方法,效果提升 104%
上海 AI Lab 提出 Harness 自进化方法,无需更换模型即可提升效果 104%。
AI 深度解读
上海 AI Lab 提出 Self-Harness 方法,让智能体自动改进外层运行装置(Harness),不换模型即可实现最高 104% 的效果提升。
- Self-Harness 将改进流程压缩为三步:弱点挖掘(从失败轨迹中提取可复用的失败模式)、修改提案(针对失败机制提出有边界的 Harness 编辑)、回归验证(在 held-in 和 held-out 上测试,确保提升且不退化)。
- 在 Terminal-Bench-2.0 上测试,固定模型、工具、环境和评测协议,仅改 Harness:Qwen3.5-35B-A3B 提升 104%,MiniMax M2.5 提升 28%,GLM-5 提升 24%。
- 不同模型暴露不同弱点:MiniMax 倾向于过度探索而不交付,Qwen 在工具失败后陷入循环,GLM 需要更好管理 shell 状态。Self-Harness 能针对性生成修复。
- 该方法已被 LangChain CEO 和前 OpenAI 副总裁 Lilian Weng 关注,标志着 Agent 社区对“自进化”外层的重视。
- 影响/看点:Self-Harness 证明 Harness 本身也可被搜索、验证和迭代,为低成本提升 Agent 性能提供了新范式。
本内容由 AI 生成,仅供参考,请注意甄别