Grok 4.7 在 ARC-AGI-3 上的评测成绩公布
Grok 4.7在ARC-AGI-3不同评测框架中的成绩为1.8%和10.0%。
AI 深度解读
ARC Prize 公布了 Grok 4.7 在 ARC-AGI-3 不同评测框架下的结果,标准框架约为 1.8%,提供商适配器框架约为 10.0%,关注价值在于同一模型的成绩会受到状态保存和推理接口设计影响。
- ARC Prize 官方结果页列出标准框架最高约 1.82%,提供商适配器框架最高约 10.05%。
- 标准框架允许模型在环境中保留自行选择的笔记;提供商适配器则保留不透明推理状态,并支持更长对话中的自动压缩。
- 两种框架并非只改变计算预算,也改变了模型跨轮次保存和复用信息的方式,因此分数不宜直接视为同一条件下的横向比较。
- ARC-AGI-3 面向交互式、适应性任务,结果更接近对智能体记忆、状态管理和行动策略的综合测试,而非单轮问答能力。
- 影响/看点:这组结果可能推动评测从单纯比较模型转向同时报告模型、推理预算和运行框架;只有在任务、预算和状态机制统一后,分数差异才更适合用于产品选型或能力判断。
- 资料依据:
- ARC Prize Grok 4.7 结果页(2026-09-21):https://arcprize.org/results/xai-grok-4-7
- ARC-AGI-3 技术报告(2026-04-22):https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf
- ARC Prize X 帖子(2026-10-06):https://x.com/arcprize/status/2107511512990433533
本内容由 AI 生成,仅供参考,请注意甄别