OpenAI 两项改进让 GPT-5.6 Sol 在 ARC-AGI-3 测试提分 188%

📡 IT之家2026-07-31 15:35

OpenAI通过两项框架改进使GPT-5.6 Sol在高难度交互推理测试ARC-AGI-3上得分提升188%,从7.8%大幅提高。

AI 深度解读

OpenAI针对号称“最严苛AI交互推理测试”的ARC-AGI-3,发现自家评测框架本身存在设计缺陷、拖累了模型表现,修复后GPT-5.6 Sol的得分从13.3%飙升到38.3%,提升188%,同时输出token数降到约六分之一,说明“考试方式不对”有时比“模型不够强”更容易被忽视。

  • ARC-AGI-3不考知识问答,而是把AI直接扔进陌生游戏环境,考验其实时探索、学习和自适应能力,被视为衡量AGI程度的顶尖交互式基准。
  • OpenAI复盘发现两个框架级问题:一是每次动作后模型的私有推理都会被丢弃,导致每步都要“重新理解”游戏;二是滚动截断窗口让早期动作记忆随对话变长而逐渐消失。
  • 解法之一是“推理保留”:用Responses API重新实现测试框架,只需传入上一次response ID,就能让模型在多轮交互中自动保留此前的思考过程。
  • 解法之二是“上下文压缩”:避免简单丢弃超长对话里最早的消息,让模型在长任务里仍能记住早期观察和已学到的信息。
  • 这提醒行业一个容易被忽略的点——同一个模型换一套“驭缰”(harness)工程,表现就能有数倍差异,评测与实际落地效果之间,框架设计本身就是一个不小的变量,而不只是模型底座在较量。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com