ARC-AGI-2:Grok 4.7 的推理 token 用量与成绩相关

📡 ARC Prize2026-10-07 00:41

ARC-AGI-2数据显示,Grok 4.7使用更多推理token时,测试得分明显提高。

AI 深度解读

ARC Prize 公布的 Grok 4.7 结果显示,ARC-AGI-2 得分随推理档位提高而上升,关注价值在于它把模型表现与推理资源投入联系起来,而不是只比较单一准确率。

  • ARC Prize 官方结果页显示,Grok 4.7 在 ARC-AGI-2 上的低、中、高、超高档得分分别为 16.7%、58.8%、58.3% 和 61.4%。
  • 这些结果表明增加推理档位可能带来更高成绩,但高档位之间并非单调上升,不能据此断言 token 数量与成绩存在简单线性关系。
  • ARC-AGI-2 设计目标是检验新任务上的抽象推理与适应能力,官方强调效率本身也是评价维度。
  • 条目所引 X 帖子把 token 用量与成绩并列呈现,但在公开结果页中更容易核验的是不同推理档位和分数,token 统计仍应结合完整实验设置解读。
  • 影响/看点:如果后续实验能在固定任务、提示和采样条件下重复这一关系,推理 token 将成为模型效果与成本之间的重要权衡指标;否则,档位差异也可能混入搜索策略、上下文保留等因素。
  • 资料依据:
  • ARC Prize Grok 4.7 结果页(2026-09-21):https://arcprize.org/results/xai-grok-4-7
  • ARC-AGI-2 官方说明(2025-05-20):https://arcprize.org/blog/arc-agi-2-technical-report
  • ARC Prize X 帖子(2026-10-06):https://x.com/arcprize/status/2107511517117571149

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手