V-Rubrics:基于量规强化学习提升多模态大模型的视觉忠实度
论文提出 V-Rubrics 强化学习方法,通过拆解细粒度评分量规,解决多模态大模型在视觉证据上的幻觉问题。
AI 深度解读
2026 年 8 月,研究团队在 arXiv 发布论文提出基于评分量规(Rubrics)的强化学习框架 V-Rubrics,用于解决多模态大模型在生成回复时存在的视觉证据脱节与幻觉问题。
- 指出传统标量结果奖励缺乏细粒度信用分配,进而将参考答案拆解为原子命题,分别从视觉忠实度(VF)、推理一致性(RC)和指令遵循(IF)三个维度进行打分。
- 构建了包含 50248 个样本的训练集 V-Rubrics 50K,通过规则过滤与拒绝采样确定样本难度,并使用 Gemini-3-Pro 进行结构化标注。
- 在基于 Qwen3-VL-8B-Instruct 微调的模型上实施分组件、前缀局部化的量规信用强化学习(GRPO)。
- 实验结果显示,该方法在知识导向与视觉基础推理基准上的表现优于基础 SFT 和单一答案标量奖励的 GRPO。
- 影响/看点:量规式细粒度奖励提供了解析多模态长链推理幻觉的有效反馈机制,其推广关键在于高质原子命题拆解标注的自动化成本与泛化可靠性。
- 资料依据:
- 1. arXiv 预印本论文(2026年8月):https://arxiv.org/abs/2608.25580
本内容由 AI 生成,仅供参考,请注意甄别