新研究发现评测框架缺乏中立性:配置微调可致模型准确率从 31% 剧烈波动至 89%

📡 Elvis Saravia2026-08-26 07:13

研究揭示评测框架缺乏中立性,仅微调提示词或选项顺序等配置,同一模型的测试得分便会在31%至89%间剧烈波动。

AI 深度解读

一项最新学术研究揭示了当前大语言模型评测框架存在显著的非中立性缺陷,评测环境配置的微调可能导致同一模型的基准得分出现极端波动。

  • 研究团队在 26 种同等合理的评测框架配置下,测试了 12 个开源模型在 3679 道相同题目上的回答表现。
  • 实验表明,仅调整选项顺序、提示词措辞以及答案读取与提取方式,gemma4-31b 模型的准确率得分即可在 31% 到 89% 的区间内剧烈波动。
  • 数据显示对评测配置敏感的题目贡献了相邻模型间 95.7% 的分差,且 4 个不同模型均能在特定配置下跃升至第一名;同时常用的基准压缩方法筛选出的样本往往是对配置最脆弱的题目。
  • 影响/看点:评测框架的高敏感性意味着现有排行榜数据可能无法反映模型的真实综合实力,建立更加鲁棒与标准化的评测协议成为全行业获取客观技术参考的关键条件。
  • 资料依据:
  • X:Elvis Saravia (@omarsar0)(https://x.com/omarsar0/status/2092389950532554920)

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手