最新研究:LLM 排行榜受评测配置影响显著,同一模型得分可在 31% 到 89% 间大幅波动
最新研究发现大模型排行榜名次高度依赖评测配置,同一模型在不同常规设置下得分波动可达数倍。
AI 深度解读
2026年8月31日公布的一项最新预印本研究(arXiv:2608.21382)揭示,大语言模型排行榜在很大程度上受评测配置变动影响,单一基准设置无法客观代表模型的真实能力排序。
- 研究团队在固定12个开源指令微调模型和3679道多选评测题目的前提下,仅调整提示词格式、选项排列顺序及打分方式等26种有效评测配置,发现模型得分出现宽幅波动。
- 实验数据显示,gemma4-31b 模型在不同合理配置下的准确率在 31% 至 89% 之间浮动,且测试的12个模型中有4个至少在一种配置下名列榜首。
- 论文分析指出,相邻模型平均95.7%的分数差距来自于因配置变动而导致答案翻转的脆弱题目,其中最大的不稳定性来源是打分机制(生成文本判定还是按对数似然选择)。
- 影响/看点:这一发现意味着当前的静态排行榜名次可能存在评测偶然性,未来行业评测基准若要具备更高公信力,需引入涵盖多重配置的区间评分机制而非单一确定性数值。
- 资料依据:
- arXiv 预印本论文(2026-08-31):https://arxiv.org/abs/2608.21382
- X:Rohan Paul (@rohanpaul_ai)(2026-08-31):https://x.com/rohanpaul_ai/status/2094545283258728623
本内容由 AI 生成,仅供参考,请注意甄别