Ethan Mollick 质疑:AI 长时程智能体基准 METR 是否已趋于饱和?

📡 Ethan Mollick2026-09-08 22:04

学者 Ethan Mollick 发文质疑 AI 长时程基准 METR 趋于饱和,指出新一代模型在特定环境下已能完成数周工作量。

AI 深度解读

宾夕法尼亚大学沃顿商学院学者 Ethan Mollick 针对 AI 评估机构 METR 的长时程基准提出公开质疑,指出当前评估体系可能已无法有效反映最新智能体在长周期任务中的真实表现。

  • 根据 Ethan Mollick 于 2026 年 9 月 8 日发布的观点,METR 广为人知的 AI 进展追踪图表自 2026 年 5 月后未见更新,而多项已公开的研究显示,在特定测试脚手架(harnesses)中,智能体已能在受控环境下完成等同于 18 周以上工作量的任务。
  • 讨论指出,虽然模型在执行单一长任务时的表现趋于可用,但现行基准未能充分检验智能体跨会话决策遗忘、上下文状态丢失等深层问题。
  • 该观点认为长时程能力测试正面临指标饱和,传统的单一任务时长维度已难以准确表征前沿智能体系统的可靠性与自主性差异。
  • 影响/看点:若现有长时程测试基准确实触及上限,可能推动评估机构与学术界重构引入多会话记忆与复杂环境扰动的评测框架;但这一评估转变的前提在于相关研究对超长周期任务完成度的衡量具备严格的可复现性与工业验证标准。
  • 资料依据:
  • X:Ethan Mollick (@emollick)(2026-09-08):https://x.com/emollick/status/2097325310349914202

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手