OpenAI多次修改GPT-6 Astra基准测试数据,部分成绩出现大幅调整
OpenAI在发布GPT-6 Astra后多次修改基准测试数据,调高自身成绩并下调竞品表现,发布过程亦现波折。
AI 深度解读
据 IT之家 2026 年 9 月 6 日引述报道,OpenAI 在 2026 年 9 月 3 日发布 GPT-6 Astra 模型公告后多次修改评测基准数据与竞品对比分值,引发业界对大模型基准测试标准化与透明度的关注。
- 发布过程与数据调整:OpenAI 官方博客在发布初期遭遇撤下与延迟上线,随后其公布的 Astra 幻觉率、数学基准 FrontierMath Tier 4 及 ExploitBench 测试等数据经历多次修改与回滚。
- 竞品成绩同步变动:在首版与后续网页快照中,Anthropic 旗下 Fable 5.1 在数学评测中的对比成绩一度由 87.8% 下调至 78%,随后又调整为 83%。
- 官方归因与测试差异:OpenAI 发言人解释称数据修正系因模型检查点、测试框架及运行方式不同所致的波动,旨在提供对可用性能的最佳估计。
- 测试框架依赖:相关评测机构指出,Astra 在 ARC-AGI-3 等测试中的高分表现依赖于特定的测试工具框架,在常规测试环境下的实际表现可能存在差异。
- 影响/看点:这一事件可能促使行业加速建立更加严格、透明的第三方独立评测机制,其成立前提在于测试环境、提示词配置与运行流程的公开与标准化复现。
- 资料依据:
- OpenAI(2026-09-03):https://openai.com/index/introducing-gpt-6-astra/
- IT之家(2026-09-06):https://www.ithome.com/0/998/927.htm
本内容由 AI 生成,仅供参考,请注意甄别