仅用 MLP:多模态大语言模型的高效视觉状态重构方法
研究发现视觉影响集中在低维子空间,提出低秩重构方法,在保留完整视觉Token的同时显著降低多模态大模型的计算开销。
AI 深度解读
研究人员提出多模态大语言模型视觉状态重构方法 δ-Vision,旨在不丢弃视觉 Token 的前提下降低视觉序列在 Transformer 层间反复计算的开销。
- 传统视觉 Token 剪枝方法会永久丢失后续层可能需要的视觉线索,该研究通过低秩干预发现视觉对文本的有效影响主要集中在低维子空间。
- 实验观察到跨层视觉状态具有较强可预测性,轻量级 MLP 能够以高余弦相似度和低重构误差近似各层视觉状态。
- δ-Vision 采用轻量级低秩适配器构建逐层视觉记忆,替代视觉 Token 在 Transformer 中的逐层演化计算,同时完整保留所有 Token 供文本检索。
- 在图像与视频基准测试中,δ-Vision 在计算量相当或更低的情况下取得了优于 Token 剪枝基线的准确率,保持了推理效率。
- 影响/看点:该方法意味着长视觉序列处理可以在保留全量细节与控制推理算力之间取得更好平衡,其实际应用价值取决于高分辨率长视频等极端场景下的重构泛化能力。
- 资料依据:
- arXiv(2026-09-28):https://arxiv.org/abs/2609.34972
- Hugging Face(2026-09-28):https://huggingface.co/papers/2609.34972
本内容由 AI 生成,仅供参考,请注意甄别