Artificial Analysis 发布科研智能体基准榜单 Terminal-Bench-Science 0.1
Artificial Analysis 上线科研智能体基准榜单,首期测试中 GPT-6 Astra 与 Claude Opus 5.5 准确率分列前两名。
AI 深度解读
评测机构 Artificial Analysis 正式发布科研智能体基准榜单 Terminal-Bench-Science 0.1,系统评估了前沿模型在复杂科学计算与终端交互中的任务完成率。
- 榜单成绩:在初始测试中,GPT-6 Astra(max)以 63% 的得分位列第一,Claude Opus 5.5(xhigh)以 62% 的成绩紧随其后。
- 评测定位:该基准专注于科学研究场景,通过命令行终端环境考察模型在实验脚本编写、科学数据分析与多步骤推理中的智能体能力。
- 区分度展示:测试展现了当前头部模型在处理长链条科研任务时的能力差异,为学术机构与研发团队选型提供了量化指标。
- 影响/看点:科研智能体基准的建立有助于量化 AI 辅助科学发现(AI for Science)的自动化水平,但其实际指导价值取决于基准测试集覆盖科学领域的广度以及对实验真实复杂度的模拟程度。
- 资料依据:
- X:Artificial Analysis(2026-09-24):https://x.com/ArtificialAnlys/status/2103265956479070260
- Artificial Analysis(2026-09-24):https://artificialanalysis.ai/leaderboards/benchmarks/terminal-bench-science
本内容由 AI 生成,仅供参考,请注意甄别