OmniDelta:全模态大语言模型中基于技能驱动的Token压缩预算分配
提出OmniDelta框架,通过意图和内容感知的预算分配压缩全模态LLM的Token序列。
AI 深度解读
OmniDelta提出技能驱动的预算分配框架,在不训练的情况下优化全模态模型中的长音频-视频token压缩,实现效率与精度的双赢。
- 问题背景:全模态大语言模型处理长音频视频序列时,token数量巨大,现有压缩方法忽视不同模态间的预算分配。
- 创新方案:构建音频和视频技能池,根据查询意图调整各模态的保留token预算;再基于局部复杂度和时间冗余分配段内预算。
- 兼容性:可结合现有剪枝策略,保留总保留率不变,只改变预算分布。
- 性能结果:在Qwen2.5-Omni-7B上,25% token保留时GPU内存减少22%,端到端加速1.64倍,且保持或提升精度。
- 看点:OmniDelta以零训练代价突破了全模态模型的效率瓶颈,为多模态推理在资源受限场景中的部署铺平道路。
本内容由 AI 生成,仅供参考,请注意甄别