ARC Prize 公布 Grok 4.7 在 ARC-AGI 系列基准上的成绩

📡 ARC Prize2026-10-07 00:41

ARC Prize 公布 Grok 4.7 在 ARC-AGI 三项基准上的成绩,部分项目低于前代。

AI 深度解读

ARC Prize 官方账号(2026-10-06)公布了 Grok 4.7 在 ARC-AGI-1、ARC-AGI-2 和 ARC-AGI-3 Verified 上的成绩及任务成本;这值得关注,因为同一模型在不同版本基准上的得分差异,可以反映任务设计、评测协议和资源消耗对结果的影响。

  • 输入材料给出的成绩为 ARC-AGI-1 90.2%、ARC-AGI-2 61.4%,以及 ARC-AGI-3 在不同 harness 下的 1.8%和 10.0%。
  • ARC Prize 官方说明,ARC-AGI 关注陌生任务上的技能获取效率、抽象和泛化,而不是一般知识问答能力。
  • ARC-AGI-3 的两组结果使用不同 harness 和成本,不能简单视为同一条件下的直接横向比较。
  • 与 Grok 4.6 的升降关系只能说明在这些特定测试配置下的变化,不能直接推导整体模型能力或通用智能水平。
  • 影响/看点:结果可能促使模型评测更重视可复现的运行协议、成本和代理工具配置;其解释力取决于测试集隔离、提示与工具条件、重复实验和独立复核。
  • 资料依据:
  • ARC Prize(2026-10-06):https://x.com/arcprize/status/2107511511782420924
  • ARC-AGI Series(2026-10-05):https://arcprize.org/arc-agi
  • ARC-AGI-3 竞赛页面(2026-10-05):https://www.kaggle.com/competitions/arc-agi-3

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手