Chatbot Arena推出AutoEval快速评测新方法
Chatbot Arena推出AutoEval评测方法,用奖励模型替代人工评测,速度从数天缩至数小时
AI 深度解读
Chatbot Arena 推出新的评测方法 AutoEval,核心是用一个基于海量真实用户偏好训练出来的奖励模型来给参赛模型打分排名,把原本需要数天才能完成的人工众包评测压缩到几个小时,值得做模型评估的人关注。
- 奖励模型的训练数据来自数百万条真实 Arena 用户的偏好投票,而不是人工标注的小样本
- 评测速度提升了数个数量级,从传统的“数天出榜”变成“数小时出分”
- 覆盖文本、视觉、图像、代码四大类竞技场,基本对齐 Arena 现有的评测板块
- 官方强调该方法与真实人工评测结果高度一致,不是简单的代理指标
- 新模型上线 Arena 后可以直接看到 AutoEval 给出的预估分数,不用等人工投票攒够样本量
- 评测周期的大幅缩短意味着新模型上线后能更快拿到相对可信的排名参考,对模型厂商调整迭代节奏、对开发者选型时效性都是利好,但奖励模型本身是否会带来新的系统性偏差,还有待观察。
本内容由 AI 生成,仅供参考,请注意甄别