区域级策略优化:通过粗细粒度解耦提升多模态大模型细粒度感知效率
研究提出粗细粒度解耦策略,先通过低分辨率粗视图定位兴趣区再聚焦识别,显著降低多模态感知计算开销。
AI 深度解读
研究团队提出区域级策略优化方法 Vision-RL2,通过粗细粒度解耦定位与识别过程,降低多模态大模型细粒度视觉感知的 token 计算开销。
- 诊断实验表明感兴趣区域(RoI)定位容忍的 token 压缩比内容识别高出约 3 至 4 倍,具备采用粗视角定位并聚焦关键区域的先决条件。
- Vision-RL2 采用区域级强化学习优化轻量候选区域网络,利用冻结的 MLLM 根据区域剔除前后的答案似然变化进行评分,无需人工区域标注与推理轨迹采样。
- 结合互补的减法与加法优化目标抑制干扰区域并找回缺失证据,再经稀疏编码放大有效证据并剔除背景 token。
- 在 6 项细粒度基准和 4 种 MLLM 骨干上,Vision-RL2 在各 token 预算下均优于基线,并以少约 4 倍的视觉 token 达到或超越原模型最大预算时的准确率。
- 影响/看点:该方法验证了无需标注的区域强化学习在视觉 token 裁剪中的可行性,若在视频理解与端侧高吞吐部署中保持推理精度,可能显著降低高分辨率多模态模型的服务成本。
- 资料依据:
- arXiv(2026-09-17):https://arxiv.org/abs/2609.19745
- GitHub(2026-09-17):https://github.com/YuHengsss/VisionRL2
本内容由 AI 生成,仅供参考,请注意甄别