Terminal-Bench-Science 发布:用于评估科学研究工作流中 AI Agent 的基准测试

📡 Hacker News 热门2026-08-28 20:04

新基准测试 Terminal-Bench-Science 发布,用于评估 AI Agent 在科学研究工作流中的实际表现。

AI 深度解读

斯坦福大学与劳德研究所(Laude Institute)于2026年8月联合发布面向自然科学计算工作流的基准测试 Terminal-Bench-Science 0.1 版,为评估 AI Agent 在真实科研计算环境中的执行能力提供了标准化测试框架。

  • 评测场景转向真实科研管线:根据项目官方公告(2026年8月27日),该基准脱离了以往科学能力评估侧重静态概念与教科书问答的模式,依托容器化环境运行实际科研任务,覆盖生命科学、物理科学、地球科学与数学工程等领域。
  • 采用确定性程序化验证:所有测试任务均在沙盒终端中执行,并通过代码脚本对输出结果进行自动化验证,直接检验智能体在安装环境、调用领域软件与处理实验数据时的端到端能力。
  • 揭示前沿模型在专业场景的性能落差:首期发布的70项任务评测显示,当前顶尖模型的任务解决率仅约30%,相较其在通用终端编程基准上的表现出现超10个百分点的下滑,反映出多步骤科学工具调用与长链路推理仍存在明显瓶颈。
  • 引入开放的科研社区共建机制:项目通过开源看板与提交渠道,鼓励一线科研人员持续贡献真实工作流中的痛点任务,以缩小模型研发与实际科研应用之间的脱节。
  • 影响/看点:该基准为科学研究领域的 AI Agent 能力评测建立了更贴近实战的衡量标准,但其能否实质性推动科研自动化工具迭代,取决于后续领域专家任务库的覆盖广度以及对复杂多步骤容错机制的评测有效性。
  • 资料依据:
  • 1. Terminal-Bench-Science 官方发布公告 (https://www.terminal-bench-science.ai/announcement)
  • 2. Terminal-Bench-Science 开源项目主页 (https://github.com/laude-institute/terminal-bench-science)

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手