Opus 5 在 ARC-AGI-3 上创下新SOTA,达30%
Opus 5在无先验知识的ARC-AGI-3基准上创下新SOTA,得分达到30%。
AI 深度解读
ARC-AGI 基准测试创始人 François Chollet 公布,Anthropic 的 Opus 5 在 ARC-AGI-3 上刷新纪录,达到 30% 的新 SOTA。
- Opus 5 在 ARC-AGI-3 测试集上取得目前最高分,达到 30%
- ARC-AGI-3 专门衡量模型在没有先验知识、没有针对性训练的情况下解决全新问题的能力
- Chollet 特别指出,这正是过去单纯靠堆算力扩展规模收效甚微的领域
- 他将这次提升评价为令人印象深刻的飞跃,而非渐进式的小幅改善
- ARC-AGI 系列一直被视为衡量模型真实推理能力而非记忆套路匹配的重要标尺,Opus 5 在这个偏难、偏陌生问题的子测试上取得突破,是判断新一代模型是否具备更通用推理能力的重要信号。
本内容由 AI 生成,仅供参考,请注意甄别