ARC-AGI-2:Grok 4.7 的推理 token 用量与成绩相关
ARC-AGI-2数据显示,Grok 4.7使用更多推理token时,测试得分明显提高。
AI 深度解读
ARC Prize 公布的 Grok 4.7 结果显示,ARC-AGI-2 得分随推理档位提高而上升,关注价值在于它把模型表现与推理资源投入联系起来,而不是只比较单一准确率。
- ARC Prize 官方结果页显示,Grok 4.7 在 ARC-AGI-2 上的低、中、高、超高档得分分别为 16.7%、58.8%、58.3% 和 61.4%。
- 这些结果表明增加推理档位可能带来更高成绩,但高档位之间并非单调上升,不能据此断言 token 数量与成绩存在简单线性关系。
- ARC-AGI-2 设计目标是检验新任务上的抽象推理与适应能力,官方强调效率本身也是评价维度。
- 条目所引 X 帖子把 token 用量与成绩并列呈现,但在公开结果页中更容易核验的是不同推理档位和分数,token 统计仍应结合完整实验设置解读。
- 影响/看点:如果后续实验能在固定任务、提示和采样条件下重复这一关系,推理 token 将成为模型效果与成本之间的重要权衡指标;否则,档位差异也可能混入搜索策略、上下文保留等因素。
- 资料依据:
- ARC Prize Grok 4.7 结果页(2026-09-21):https://arcprize.org/results/xai-grok-4-7
- ARC-AGI-2 官方说明(2025-05-20):https://arcprize.org/blog/arc-agi-2-technical-report
- ARC Prize X 帖子(2026-10-06):https://x.com/arcprize/status/2107511517117571149
本内容由 AI 生成,仅供参考,请注意甄别