Claude Opus 5 登顶 ARC-AGI-3 基准,刷新 SOTA 至 30.2%

📡 Ethan Mollick2026-07-25 03:08

Claude Opus 5登顶ARC-AGI-3,以30.2%刷新纪录,大幅超过此前最高分7.8%。

AI 深度解读

Claude Opus 5 在 ARC-AGI-3 基准上跑出 30.2% 的成绩,一举刷新纪录,较此前由 GPT-5.6 Sol(Max)保持的 7.8% 提升近 4 倍,ARC Prize 官方也罕见地用「巨大飞跃」来形容这次结果,值得关注 Claude 系列在通用推理上的又一次跃升。

  • ARC-AGI-3 专测模型面对全新未见场景时的抽象推理与举一反三能力,刻意规避死记硬背式的模式匹配,是公认难啃的通用智能基准。
  • 30.2% 对比上一代最高分 7.8%,是接近四倍的跨越而非渐进式小幅提升,暗示这次进步可能来自解题机制上的质变,而不只是参数或算力的堆叠。
  • ARC Prize 团队在分析中特别提到观察到「新颖行为」,即 Opus 5 展现出此前模型都不具备的解题路径,能攻克过去完全无法解决的场景类型。
  • 消息还提到 Opus 5 在该基准上的表现超越了 Fable,说明 Anthropic 在这一细分推理能力上暂时建立了相对优势。
  • 目前信息来自 ARC Prize 官方账号及 Ethan Mollick 的转发,可信度较高,但仍是单一基准的单点结果,后续还需更多独立复现和跨基准验证。
  • 如果这次提升能在其他推理类基准上得到印证,说明 Claude 正在从「套用已知模式」走向「真正理解新问题」,后续值得盯紧 Opus 5 在 ARC-AGI-2、GPQA 等基准上的联动表现。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com