最新研究:LLM 排行榜受评测配置影响显著,同一模型得分可在 31% 到 89% 间大幅波动

📡 Rohan Paul2026-09-01 05:58

最新研究发现大模型排行榜名次高度依赖评测配置,同一模型在不同常规设置下得分波动可达数倍。

AI 深度解读

2026年8月31日公布的一项最新预印本研究(arXiv:2608.21382)揭示,大语言模型排行榜在很大程度上受评测配置变动影响,单一基准设置无法客观代表模型的真实能力排序。

  • 研究团队在固定12个开源指令微调模型和3679道多选评测题目的前提下,仅调整提示词格式、选项排列顺序及打分方式等26种有效评测配置,发现模型得分出现宽幅波动。
  • 实验数据显示,gemma4-31b 模型在不同合理配置下的准确率在 31% 至 89% 之间浮动,且测试的12个模型中有4个至少在一种配置下名列榜首。
  • 论文分析指出,相邻模型平均95.7%的分数差距来自于因配置变动而导致答案翻转的脆弱题目,其中最大的不稳定性来源是打分机制(生成文本判定还是按对数似然选择)。
  • 影响/看点:这一发现意味着当前的静态排行榜名次可能存在评测偶然性,未来行业评测基准若要具备更高公信力,需引入涵盖多重配置的区间评分机制而非单一确定性数值。
  • 资料依据:
  • arXiv 预印本论文(2026-08-31):https://arxiv.org/abs/2608.21382
  • X:Rohan Paul (@rohanpaul_ai)(2026-08-31):https://x.com/rohanpaul_ai/status/2094545283258728623

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手