OpenAI 修复评测程序漏洞,GPT-5.6 Sol 在 ARC-AGI-3 分数暴涨近三倍
OpenAI发现评测程序此前丢弃模型私有推理链并截断上下文,仅调整两个API设置后GPT-5.6 Sol在ARC-AGI-3上的分数从13.3%涨到38.3%,且token消耗大幅降低。
AI 深度解读
OpenAI 复盘发现自家 GPT-5.6 Sol 模型在 ARC-AGI-3 上的低分很大程度是评测工具的锅:只调整两个 API 设置,同一模型的分数就从 13.3% 暴涨到 38.3%,暴露出评测框架(harness)设计缺陷可能长期低估模型真实能力。
- 问题根源是此前的评测程序会丢弃模型的私有推理链并截断上下文,导致模型在多轮交互中“失忆”,无法延续之前的推理成果
- 修复后模型在“高”档设置下即可达到旧版“最高”档的分数,说明此前的分数很大程度是被评测方式而非模型能力压低的
- 修复同时带来效率红利:最高档每局输出 token 从 290 万降至 49 万,token 消耗相差约 12 倍
- OpenAI 主动公开复盘细节,反映出评测方法本身正成为衡量模型能力时不可忽视的变量
- 影响:这一发现提醒行业在解读跑分榜单时要警惕评测工具本身引入的系统性偏差,同一模型换一套评测框架分数可能差出近三倍,横向比较模型能力时需格外谨慎。
本内容由 AI 生成,仅供参考,请注意甄别