耶鲁大学等论文指出物理基准质量缺陷:GPT-5.6 修正后得分飙升至 78.7%
耶鲁等机构发文指出物理评测基准存在质量缺陷,经专家纠错复评后 GPT-5.6 得分升至 78.7%。
AI 深度解读
耶鲁大学联合多家机构发布物理基准审计论文,指出当前主流物理评测集存在显著的数据与评分缺陷,导致前沿模型实际能力被系统性低估。
- 缺陷审计:研究团队系统审计了 6 个主流物理基准,发现题目表述不清、参考答案错误以及自动评分器逻辑脆弱是模型被判失败的主要原因。
- 真实错误率低:在抽样审计的 4 个基准子集共 250 个被拒案例中,经专家复核确认仅有 12 个属于模型自身的真实错误。
- 得分大幅重估:在修正评测缺陷并经专家复评后,GPT-5.6-Sol 在 HLE-Physics 上的基准得分从 47.3% 修正提升至 78.7%。
- 影响/看点:该结论表明现有部分前沿模型在特定物理领域的解题能力可能已被基准噪音压制,未来评测体系若不转向专家级严谨校验,将难以准确衡量前沿模型的真实能力边界。
- 资料依据:
- X:Rohan Paul (@rohanpaul_ai)(2026-09-16):https://x.com/rohanpaul_ai/status/2100320168597753947
- arXiv 预印本论文(2026-09-16):https://arxiv.org/abs/2609.10234
本内容由 AI 生成,仅供参考,请注意甄别