沃顿商学院教授批评当前主流 AI 基准测试缺乏有效性
沃顿商学院教授批评GDPval-AA等主流AI基准测试完全依赖AI评分且缺乏有效性,呼吁停止盲目引用。
AI 深度解读
2026年9月8日,沃顿商学院教授 Ethan Mollick 发文批评当前以 GDPval-AA 为代表的主流 AI 基准测试缺乏评估有效性,指出了行业在模型能力衡量上过度依赖自动化评判的潜在偏差。
- Mollick 指出,该类基准测试通常让 AI 回答具有主观判断性的公开问题,并由其他 AI 充当裁判而非人类专家进行评分,在测试方法论上存在有效性缺陷。
- 尽管自动化评估机制存在局限,部分主流 AI 实验室与评测机构仍广泛引用此类数据,导致跑分结果可能无法客观反映模型在复杂现实任务中的真实表现。
- 行业对自动化评分争议的关注,反映出随着大模型能力演进,构建高可信度、标准化且具备人类专业水准的基准测试已成为评估体系的核心短板。
- 影响/看点:这一批评可能促使学界与产业界重新审视基于“AI裁判”(LLM-as-a-Judge)的评估体系,其能否推动评测标准变革取决于行业能否建立起更具经济可行性的人类专家评测机制。
- 资料依据:
- X:Ethan Mollick(2026-09-08):https://x.com/emollick/status/2097187385930891643
本内容由 AI 生成,仅供参考,请注意甄别