Grok 4.7 在 ARC-AGI-3 上的评测成绩公布

📡 ARC Prize2026-10-07 00:41

Grok 4.7在ARC-AGI-3不同评测框架中的成绩为1.8%和10.0%。

AI 深度解读

ARC Prize 公布了 Grok 4.7 在 ARC-AGI-3 不同评测框架下的结果,标准框架约为 1.8%,提供商适配器框架约为 10.0%,关注价值在于同一模型的成绩会受到状态保存和推理接口设计影响。

  • ARC Prize 官方结果页列出标准框架最高约 1.82%,提供商适配器框架最高约 10.05%。
  • 标准框架允许模型在环境中保留自行选择的笔记;提供商适配器则保留不透明推理状态,并支持更长对话中的自动压缩。
  • 两种框架并非只改变计算预算,也改变了模型跨轮次保存和复用信息的方式,因此分数不宜直接视为同一条件下的横向比较。
  • ARC-AGI-3 面向交互式、适应性任务,结果更接近对智能体记忆、状态管理和行动策略的综合测试,而非单轮问答能力。
  • 影响/看点:这组结果可能推动评测从单纯比较模型转向同时报告模型、推理预算和运行框架;只有在任务、预算和状态机制统一后,分数差异才更适合用于产品选型或能力判断。
  • 资料依据:
  • ARC Prize Grok 4.7 结果页(2026-09-21):https://arcprize.org/results/xai-grok-4-7
  • ARC-AGI-3 技术报告(2026-04-22):https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf
  • ARC Prize X 帖子(2026-10-06):https://x.com/arcprize/status/2107511512990433533

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手