GPT-6 Astra 刷穿高难度数学基准 FrontierMath Tier 4
OpenAI旗下GPT-6 Astra在前沿高难度数学基准测试FrontierMath Tier 4中取得饱和满分成绩。
AI 深度解读
OpenAI 旗下 GPT-6 Astra 成功攻克 FrontierMath Tier 4 的最后一题,使这一研究级数学基准的所有题目在历次测试中均被 AI 至少解出一次。
- Epoch AI 正式确认研究级数学评测集 FrontierMath Tier 4 的所有题目已被大模型历次累积解答覆盖,宣布该层级达到饱和状态。
- GPT-6 Astra 在 Tier 4 独立测试中取得 97.6% 的正确率,并攻破了此前未被任何模型攻克的最后一道难题。
- 出题专家指出模型在本次解题中展现出了与人类数学家接近的推导逻辑,而非依赖数值捷径。
- 在要求严格形式化证明的 FrontierMath Erdős 评测集(共 68 题)中,Astra 仅解出 2 题,显示开放性前沿数学探索仍具极高门槛。
- 影响/看点:意味着传统闭卷研究级数学基准对顶尖模型的区分能力基本饱和,未来前沿数学评测将进一步转向完全未解的开放问题与形式化定理证明。
- 资料依据:
- 量子位(2026-09-12):https://www.qbitai.com/2026/09/487701.html
- Epoch AI(2026-09-12):https://epochai.org/frontiermath
本内容由 AI 生成,仅供参考,请注意甄别