字节跳动提出 HarnessDev 基准:评估大模型自主构建与演化 Agent Harness 能力

📡 Elvis Saravia2026-09-02 23:24

字节跳动 Seed 团队提出 HarnessDev 基准,用于评估大模型自主构建与演化智能体框架的能力。

AI 深度解读

字节跳动 Seed 团队等机构于 2026 年 9 月 2 日发布论文提出 HarnessDev 基准,将大模型评测对象从下游任务输出拓展至模型自主构建与迭代智能体运行架构(harness)的工程能力。

  • HarnessDev 将评估划分为从极简种子构建完整执行环境的「创建」阶段,以及根据执行反馈自我调优的「演化」阶段。
  • 评测覆盖 6 款大模型、4 个领域及 5 个下游基准(共 2,207 个任务样本),从任务完成率与 Token 执行成本两维度综合计分。
  • 实验显示,模型自动生成的运行架构在代码与深度研究任务上仍明显落后于人工工程参考方案,但在文本写作与机器学习实验任务中表现接近或持平人工方案。
  • 架构演化带来的性能提升存在不稳定性,且高度依赖实际执行任务的底层模型,跨模型迁移效果有限。
  • 影响/看点:这一基准为智能体系统的自动化构建与自适应演进提供了标准化评估范式,其落地实用性取决于自动生成架构对不同运行端模型的泛化稳定性与 Token 成本控制。
  • 资料依据:
  • arXiv 论文(2026-09-02):https://arxiv.org/abs/2609.01437
  • X:Elvis Saravia(2026-09-02):https://x.com/omarsar0/status/2095170896407548190

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手