François Chollet 实测 GPT-6 Astra:ARC-AGI-3 交互推理接近满分
François Chollet 实测指出 GPT-6 Astra 交互推理能力显著提升,在 ARC-AGI-3 测试中配合持续对话接近满分。
AI 深度解读
ARC Prize 公布 GPT-6 Astra 在 ARC-AGI-3 上的测试结果,标准 harness 得分为 62.7%,使用 Provider Adapter harness 时达到 99.9%,关注价值在于结果同时展示了模型能力与工具、上下文管理机制的影响。
- ARC-AGI-3 要求智能体在陌生的回合制环境中探索规则、建立模型、设定目标并执行计划。
- ARC Prize 记录称,Astra 在 Provider Adapter 条件下有 96%的关卡使用动作少于人类基线。
- 两种 harness 的接口和上下文保留方式不同,因此 62.7%与99.9%不能视为同一条件下的简单提升。
- ARC Prize 明确指出,该基准环境封闭、目标有限,取得高分不构成达到通用人工智能的证明。
- 影响/看点:结果可能说明持续上下文和状态压缩已成为智能体性能的重要组成部分;能否迁移到开放世界任务,取决于环境复杂度、目标不确定性和错误代价。
- 资料依据:
- ARC Prize(2026-09-03):GPT-6 Astra on ARC-AGI-3 https://arcprize.org/blog/astra
- François Chollet(2026-09-03):ARC-AGI-3 测试说明 https://x.com/fchollet/status/2095598451115614371
本内容由 AI 生成,仅供参考,请注意甄别