ARC-AGI 评测:OpenAI GPT-6 Astra 表现分析
评测机构发布了 OpenAI GPT-6 Astra 模型在通用推理基准 ARC-AGI-3 上的测试表现分析。
AI 深度解读
ARC Prize 于 2026 年 9 月 3 日公布 OpenAI GPT-6 Astra 在智能体基准 ARC-AGI-3 上的评测结果,展示了前沿模型在抽象环境中的因果建模能力。
- 在标准框架下模型得分 62.7%(成本 2.6 万美元);在保留隐式推理状态的适配框架下得分达 99.9%(成本 1.9 万美元)。
- 在适配框架下,模型在 96% 的关卡中操作步数少于人类中值基准,平均每关动作减少 51.7%。
- 模型展现出主动符号建模特征,能自主构建紧凑的领域简记法记录规则、坐标并规划多步动作。
- 接入代码沙盒时,模型能编写定制脚本(如迷宫求解器)辅助解题。
- 影响/看点:该进展意味着模型在封闭确定性交互环境中具备接近人类的探索效率,但其泛化能力能否迁移至真实世界仍取决于开放环境下的应对表现。
- 资料依据:
- ARC Prize(2026-09-03):https://arcprize.org/blog/astra
- arXiv(2026-03-24):https://arxiv.org/pdf/2603.24621
本内容由 AI 生成,仅供参考,请注意甄别