研究发现大模型存在“解高难题缺基础”现象:Qwen3-80B 基础一致性仅 48%
研究发现大模型普遍存在答对高难题却答错前置基础题的断层现象,建议采用难易关联题组进行评估。
AI 深度解读
一项基于知识空间理论(KST)的评估研究于 2026 年 9 月对比了 8 个大语言模型与逾 1.8 万名人类学习者,发现大模型在数学推理中存在“能解难题却答错前置基础题”的结构性断层。
- 测试数据显示,人类在答对高阶难题时有 72.7% 同时答对所有前置基础题(整体得分 79.6%),表现出较高的一致性。
- Qwen3-80B-Instruct 虽取得 92.5% 的整体高分,但仅有 48.16% 的正确答案满足前置一致性要求。
- 实验表明,在上下文提供前置知识示例并未稳定提升模型在依赖问题上的表现,且常规的准确率指标与 LLM 评审大多难以察觉此类知识断层。
- 论文建议评估推理模型时应采用具备依赖关系的难易关联题组,而非仅依赖孤立的单题基准。
- 影响/看点:这意味着仅看单一基准的高准确率可能会高估模型的真实推理鲁棒性,促使业界评估体系从孤立题库向层级化知识依赖评测演进。
- 资料依据:
- arXiv(2026-09-07):https://arxiv.org/abs/2609.05245
- X:Rohan Paul (@rohanpaul_ai)(2026-09-12):https://x.com/rohanpaul_ai/status/2098642587011915981
本内容由 AI 生成,仅供参考,请注意甄别