ARC Prize 评测:GPT-6 Astra 展现符号建模能力,基准测试实现重大跨越
ARC Prize 称 GPT-6 Astra 能构建符号世界模型并规划动作,ARC-AGI-3 得分最高达 99%。
AI 深度解读
X:Testing Catalog(2026-09-03)转述 ARC Prize 对 GPT-6 Astra 的观察,称其能把陌生环境压缩成符号化世界模型,并在 ARC-AGI-3 上取得 63% 标准框架得分,关注价值在于这涉及模型如何表示规则、状态和动作,而不只是最终分数。
- 原帖称 Provider Adapter harness 下得分可达 99%,说明接口和评测流程会显著影响结果。
- 所谓符号世界模型和领域速记语言,是对模型行为的研究性解释,不等同于已公开的内部架构说明。
- OpenAI《GPT-6 Astra System Card》(2026-09-03)公开了多项长程任务、代码调试和工具使用评测,但没有在该系统卡中给出 ARC-AGI-3 分数。
- 因此,ARC 分数和 ARC Prize 的行为观察应与 OpenAI 官方安全评测分开看待。
- 影响/看点:若这种规则抽象能力能迁移到未见过的任务并保持动作效率,可能提升代理处理陌生软件环境的能力;成立条件是独立任务、不同 harness 和重复实验都能得到相近结论。
- 资料依据:
- X:Testing Catalog(2026-09-03):https://x.com/testingcatalog/status/2095613562668401040
- OpenAI《GPT-6 Astra System Card》(2026-09-03):https://deploymentsafety.openai.com/gpt-6-astra
本内容由 AI 生成,仅供参考,请注意甄别