两个设置如何让GPT-5.6在ARC-AGI-3基准测试得分翻三倍
通过启用两个API设置,GPT-5.6在ARC-AGI-3基准测试中得分提升三倍。
AI 深度解读
为什么GPT-5.6在2D谜题基准测试中得分惨淡?原来问题不在模型,而在两个被忽略的API设置。开启后,得分翻三倍,且输出token减少6倍。
- 基准测试ARC-AGI-3衡量AI在未见过的2D游戏中的学习和推理能力,默认设置下GPT-5.6仅得7.8%。
- 研究人员发现,每次行动后模型的私有推理被丢弃,导致它无法记住之前思考,必须重新理解游戏。
- 开启“保留推理”和“压缩”两个设置后,得分直接翻三倍,输出token减少6倍。
- 这揭示了基准测试结果不仅反映模型能力,还受API设置、提示设计和测试框架等隐形因素影响。
- OpenAI模型在其他游戏(如宝可梦FireRed)中表现优异,说明ARC-AGI-3低分并非能力不足。
- 影响/看点:评估AI性能时不能只看基准分数,优化设置可能释放巨大潜力,也暴露了当前基准测试的局限性。
本内容由 AI 生成,仅供参考,请注意甄别