GPT-6 Astra 在新适配器框架下 ARC-AGI-3 得分达 99.9%,基准趋近饱和
GPT-6 Astra 在 ARC-AGI-3 标准框架得分 62.7%,适配器框架下升至 99.9%。
AI 深度解读
X:Rohan Paul(2026-09-03)转述 ARC Prize 分析称,GPT-6 Astra 在 ARC-AGI-3 的 Standard 框架下得分为 62.7%,切换 Provider Adapter harness 后达到 99.9%,关注价值在于同一模型因评测接口变化而出现显著分差。
- 两个分数来自不同 harness,不能直接视为模型能力提升了 37.2 个百分点。
- 原帖称 Astra 在 96% 的关卡中超过人类表现,但未提供完整样本、评分脚本和人类基线细节。
- OpenAI《GPT-6 Astra System Card》(2026-09-03)也显示,官方正在用更贴近真实任务的新评测替代趋于饱和的旧基准。
- 这说明基准饱和既可能来自模型变强,也可能来自任务设计无法继续区分能力层级。
- 影响/看点:若新框架的任务定义、成本核算和独立复测均透明,ARC-AGI-3 可能转向效率与泛化能力比较;在此之前,99.9% 不宜脱离测试条件单独解读。
- 资料依据:
- X:Rohan Paul(2026-09-03):https://x.com/rohanpaul_ai/status/2095640216199672279
- OpenAI《GPT-6 Astra System Card》(2026-09-03):https://deploymentsafety.openai.com/gpt-6-astra
本内容由 AI 生成,仅供参考,请注意甄别