Kimi 发布视觉感知基准 PerceptionBench
Kimi发布视觉感知基准PerceptionBench,含3000道单能力测试题。
AI 深度解读
Kimi团队发布视觉感知专项基准PerceptionBench,试图把「看得准不准」从「推理对不对」中剥离出来单独评测,填补当前多模态模型评测中感知能力被推理能力掩盖的空白。
- 基准设计思路不是先定义能力再出题,而是反向从现有前沿模型在42个基准测试中的真实失败案例里,归纳出10项原子级视觉感知能力
- 据此构建了3000道经过验证的题目,每道题只考察单一感知能力,且只需要「看」就能作答,不依赖推理链或外部知识,最大限度排除推理能力对感知评测的干扰
- 配套开放了博客说明、GitHub代码仓库和Hugging Face数据集,方便其他团队直接复用评测
- 这是Kimi在发布K3同期推出的配套评测工具,显示其在推进大模型能力的同时也在补齐感知维度的专用度量手段
- 当前多模态模型评测普遍把「看错了」和「想错了」混在一起打分,PerceptionBench把纯感知能力单独拎出来测,能帮团队更精确定位模型的视觉短板到底出在识别环节还是推理环节,对多模态模型选型和调优有直接参考价值。
本内容由 AI 生成,仅供参考,请注意甄别