GPT-5.6 Sol 在 ARC-AGI-3 上是否优于 Opus 5?
官方评测中Opus 5在ARC-AGI-3上大幅领先GPT-5.6 Sol,但OpenAI改用自有API优化后Sol得分显著提升。
AI 深度解读
一场围绕ARC-AGI-3榜单的争议式对比:官方标准评测下Opus 5大幅领先GPT-5.6 Sol(30.2%对7.8%),但OpenAI换了套自有API配置重测后,Sol成绩跳到38.3%还省了6倍token,引出一个更本质的问题——这个榜单到底在测什么。
- 官方标准评测口径下,Opus 5得分30.2%,GPT-5.6 Sol只有7.8%,差距悬殊
- OpenAI用自己的API、保留推理过程并压缩长上下文重新测试后,Sol在公开游戏集上的得分升至38.3%,同时输出token减少了6倍
- 同一模型在不同调用配置下成绩相差近5倍,说明ARC-AGI-3衡量的不只是底层模型能力,还高度依赖围绕模型搭建的智能体系统(上下文管理、推理保留策略等工程细节)
- 在双方都采用官方标准评测口径的前提下,Opus 5仍是当前公开榜单上的领先者
- 这类争议提醒行业:跨模型能力对比必须锁定同一套评测协议,否则各家选优配置报数字,榜单排名的可比性会被严重稀释。
本内容由 AI 生成,仅供参考,请注意甄别