区域级策略优化:通过粗细粒度解耦提升多模态大模型细粒度感知效率

📡 HuggingFace Daily Papers2026-09-17 08:00

研究提出粗细粒度解耦策略,先通过低分辨率粗视图定位兴趣区再聚焦识别,显著降低多模态感知计算开销。

AI 深度解读

研究团队提出区域级策略优化方法 Vision-RL2,通过粗细粒度解耦定位与识别过程,降低多模态大模型细粒度视觉感知的 token 计算开销。

  • 诊断实验表明感兴趣区域(RoI)定位容忍的 token 压缩比内容识别高出约 3 至 4 倍,具备采用粗视角定位并聚焦关键区域的先决条件。
  • Vision-RL2 采用区域级强化学习优化轻量候选区域网络,利用冻结的 MLLM 根据区域剔除前后的答案似然变化进行评分,无需人工区域标注与推理轨迹采样。
  • 结合互补的减法与加法优化目标抑制干扰区域并找回缺失证据,再经稀疏编码放大有效证据并剔除背景 token。
  • 在 6 项细粒度基准和 4 种 MLLM 骨干上,Vision-RL2 在各 token 预算下均优于基线,并以少约 4 倍的视觉 token 达到或超越原模型最大预算时的准确率。
  • 影响/看点:该方法验证了无需标注的区域强化学习在视觉 token 裁剪中的可行性,若在视频理解与端侧高吞吐部署中保持推理精度,可能显著降低高分辨率多模态模型的服务成本。
  • 资料依据:
  • arXiv(2026-09-17):https://arxiv.org/abs/2609.19745
  • GitHub(2026-09-17):https://github.com/YuHengsss/VisionRL2

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手