François Chollet 回应 ARC-AGI-3 争议:基准校准严密,AI 仅用半年实现能力飞跃
François Chollet 回应争议称 ARC-AGI-3 校准无误,前沿 AI 仅用半年就将得分从不足 1% 提升至近 100%。
AI 深度解读
François Chollet 回应 ARC-AGI-3 的校准争议,称该基准在发布初期对前沿模型具有较高难度,而随后模型得分快速上升,关注价值在于讨论基准如何区分测量问题与能力进步。
- ARC Prize 官方说明,ARC-AGI-3 通过约500名普通公众测试建立人类动作效率基线,并把环境设计为可由人类完成。
- 官方定义的测试重点包括探索、建模、目标设定以及计划执行,不是单纯的知识记忆。
- Astra 在标准 harness 上为62.7%,在保留隐式推理状态的 Provider Adapter harness 上为99.9%,说明评测接口会显著影响结果。
- ARC Prize 同时强调,基准环境是封闭且规则确定的,高分不等于现实世界中的通用智能。
- 影响/看点:该争议可能推动评测报告更明确披露人类基线、工具权限和上下文机制;“六个月从低分到高分”能否代表普遍智能跃升,取决于跨基准、跨任务和独立复现实验。
- 资料依据:
- ARC Prize(2026-09-03):GPT-6 Astra on ARC-AGI-3 https://arcprize.org/blog/astra
- François Chollet(2026-09-03):ARC-AGI-3 校准与能力变化说明 https://x.com/fchollet/status/2095605239269519771
本内容由 AI 生成,仅供参考,请注意甄别