CoVeR:面向视觉语言模型多视角 3D 推理的覆盖率 Token 剪枝方法

📡 HuggingFace Daily Papers2026-09-08 08:00

针对VLM多视角3D推理中图像Token冗余的问题,提出基于空间覆盖率的剪枝方法CoVeR,在降低计算开销的同时保留全景表征。

AI 深度解读

研究人员在 arXiv 发布论文提出面向视觉语言模型多视角 3D 推理的覆盖率 Token 剪枝方法 CoVeR,在无需训练的前提下降低了多视角图像输入的计算冗余。

  • 多视角图像能让 2D 视觉语言模型复用预训练先验完成 3D 场景推理,但会生成数千个冗余视觉 Token,计算成本随视角增加持续上升。
  • 现有的特征重要性排序容易聚集在少数显著区域并产生近乎重复的 Token,而体素化方法无法严格限定 Token 预算且在视角重叠时存在保留上限。
  • CoVeR 仅利用空间坐标进行确定性选择,不依赖模型学习信号,能够在严格匹配单场景 Token 预算的同时实现对场景各区域的几何空间覆盖。
  • 实验显示该方法可作为即插即用模块适配 4 种 VLM;在仅保留约 8% 视觉 Token 的情况下,维持了 93.5% 的全量推理性能,在 3 个基准测试中平均超越此前最优方法 3.9 个百分点。
  • 影响/看点:这表明在多视角 3D 场景理解任务中,基于纯空间几何覆盖的剪枝机制可能比基于注意力权重的特征筛选更具算力性价比,其实际落地效果取决于多视角相机位姿或坐标信息的先验精度。
  • 资料依据:
  • arXiv(2026-09-08):https://arxiv.org/abs/2609.08345
  • Hugging Face Daily Papers(2026-09-08):https://huggingface.co/papers/2609.08345

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手