OpenAI 总裁格雷格:GPT-6 Astra 在 ARC-AGI-3 达 SOTA,高阶推理调用更精简
OpenAI 总裁 Brockman 称 GPT-6 Astra 在 ARC-AGI-3 达 SOTA,且高阶推理能以更少动作降低调用成本。
AI 深度解读
X:Greg Brockman(2026-09-03)转发称,GPT-6 Astra 在 ARC-AGI-3 的不同测试框架下得分差异明显,这一结果之所以受关注,在于它同时涉及模型能力、评测设计与推理成本。
- 原帖称标准 harness 得分为 63%,Provider Adapter harness 下升至 99%,两者并非同一测试条件。
- 原帖还称 Astra 在 96% 的关卡中超过受测人类表现,但未展示完整实验细节。
- OpenAI《GPT-6 Astra System Card》(2026-09-03)确认 Astra 已公开发布,并强调其在长程任务与代码调试评测中的能力提升。
- 更少动作和调用可能降低单次任务成本,但成本结论取决于模型价格、工具调用和评测实现。
- 影响/看点:若 Provider Adapter 的设置能被独立复现,评测重点可能从单一分数转向任务覆盖、动作效率与跨框架可比性;否则 99% 更适合作为特定 harness 下的结果解读。
- 资料依据:
- X:Greg Brockman(2026-09-03):https://x.com/gdb/status/2095629409017614390
- OpenAI《GPT-6 Astra System Card》(2026-09-03):https://deploymentsafety.openai.com/gpt-6-astra
本内容由 AI 生成,仅供参考,请注意甄别