OpenAI 官方复盘:两项 API 设置让 GPT-5.6 Sol 拿下 ARC-AGI-3
OpenAI复盘GPT-5.6 Sol在ARC-AGI-3表现不佳的原因是测试框架未保留其推理记忆,调整两项API设置后分数翻倍、输出token减少6倍。
AI 深度解读
OpenAI 官方发文复盘了一个反常现象:能解开数学开放问题的 GPT-5.6 Sol,却在专为测试通用推理设计的 ARC-AGI-3 拼图基准上表现挣扎,追查后发现问题出在两个容易被忽视的 API 设置上。
- 团队排查发现,测试框架本身没有让模型"记住"它在解题过程中学到的中间信息,导致模型每一步都像重新开始
- 调整两个 API 设置后,ARC-AGI-3 得分直接翻倍,同时输出 token 消耗还减少了 6 倍,说明原配置存在明显的效率浪费
- 这说明基准测试成绩很大程度上取决于评测框架/接口配置是否"喂对了"模型能力,而非纯粹反映模型本身的智能上限
- 官方主动公开这一复盘,也是在提醒社区:比较不同模型在同一基准上的分数时,要警惕评测设置本身带来的巨大方差
- 对做模型评测或选型的团队,这是一个重要提醒:跑分不理想未必是模型不行,先检查上下文记忆、工具调用等 API 配置是否拖了后腿,再下结论。
本内容由 AI 生成,仅供参考,请注意甄别