清华NLP组提出悲观验证方法,提升LLM数学证明验证准确性
清华NLP组提出悲观验证法校验LLM数学证明,准确率提升且成本降至约四分之一,助Gemini 3 Pro在IMO 2025得分翻倍。
AI 深度解读
清华大学 NLP 组(OpenBMB 团队)提出了一种叫“悲观验证”的方法,专门解决大模型自己写的数学证明“对不对”这件事一直难判断的问题,思路简单但效果显著。
- 核心做法是并行跑多次同一份证明的验证,只要有一次运行报错就直接判定为不通过,宁可错杀不放过
- 这种“悲观”策略明显提升了真负率(TNR)和平衡 F1 分数,即更善于揪出错误证明
- 团队还给出了渐进式变体,在保持同等准确率的前提下,token 消耗、运行时间和成本都只需约四分之一
- 在 IMO 2025 真实赛题上实测,把 Gemini 3 Pro 的得分从 13 分直接拉高到 22 分
- 方法本身不依赖特定模型,理论上可以套用到其他做数学证明生成的大模型上
- 看点:验证环节的可靠性一直是 LLM 数学能力落地的短板,这项工作用低成本方式补上了这块拼图,对提升模型数学竞赛表现有直接帮助。
本内容由 AI 生成,仅供参考,请注意甄别