Nathan Lambert:Harness 工程仍有大量唾手可得的提升空间
AI研究员Nathan Lambert认为harness工程仍有大量容易实现的性能提升空间,是一个值得深入研究的高性价比方向。
AI 深度解读
AI2 研究员 Nathan Lambert 借 GPT-5.6 Sol 靠改进 harness(智能体运行框架/脚手架)让分数暴涨 188% 一事,抛出一个判断:harness 工程的"低垂果实"多到不可思议,这比堆算力升级模型本身性价比高得多。
- 核心论点是同一个模型,仅靠优化运行框架(如上下文管理、工具调用策略、记忆机制)就能把跑分提升近两倍
- 他指出 harness 效果研究本身是个交叉领域,横跨后训练(post-training)和评估/推理(eval/inference)两端,目前研究得还不够系统
- 言下之意是行业过度聚焦"训练更强的模型",而忽视了"如何更好地驱动现有模型"这个同样关键的杠杆
- 这类优化的性价比(每单位性能提升所需成本)可能远高于继续堆参数或算力
- 对于做 AI 应用和智能体产品的团队,这是一个务实提醒:与其等下一代模型,不如先把自己的 harness/prompt 编排打磨到位,收益可能立竿见影。
本内容由 AI 生成,仅供参考,请注意甄别