两个设置如何让GPT-5.6在ARC-AGI-3基准测试得分翻三倍

📡 OpenAI News2026-07-29 23:00

通过启用两个API设置,GPT-5.6在ARC-AGI-3基准测试中得分提升三倍。

AI 深度解读

为什么GPT-5.6在2D谜题基准测试中得分惨淡?原来问题不在模型,而在两个被忽略的API设置。开启后,得分翻三倍,且输出token减少6倍。

  • 基准测试ARC-AGI-3衡量AI在未见过的2D游戏中的学习和推理能力,默认设置下GPT-5.6仅得7.8%。
  • 研究人员发现,每次行动后模型的私有推理被丢弃,导致它无法记住之前思考,必须重新理解游戏。
  • 开启“保留推理”和“压缩”两个设置后,得分直接翻三倍,输出token减少6倍。
  • 这揭示了基准测试结果不仅反映模型能力,还受API设置、提示设计和测试框架等隐形因素影响。
  • OpenAI模型在其他游戏(如宝可梦FireRed)中表现优异,说明ARC-AGI-3低分并非能力不足。
  • 影响/看点:评估AI性能时不能只看基准分数,优化设置可能释放巨大潜力,也暴露了当前基准测试的局限性。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com