OmniDelta:全模态大语言模型中基于技能驱动的Token压缩预算分配

📡 HuggingFace Daily Papers2026-07-28 08:00

提出OmniDelta框架,通过意图和内容感知的预算分配压缩全模态LLM的Token序列。

AI 深度解读

OmniDelta提出技能驱动的预算分配框架,在不训练的情况下优化全模态模型中的长音频-视频token压缩,实现效率与精度的双赢。

  • 问题背景:全模态大语言模型处理长音频视频序列时,token数量巨大,现有压缩方法忽视不同模态间的预算分配。
  • 创新方案:构建音频和视频技能池,根据查询意图调整各模态的保留token预算;再基于局部复杂度和时间冗余分配段内预算。
  • 兼容性:可结合现有剪枝策略,保留总保留率不变,只改变预算分布。
  • 性能结果:在Qwen2.5-Omni-7B上,25% token保留时GPU内存减少22%,端到端加速1.64倍,且保持或提升精度。
  • 看点:OmniDelta以零训练代价突破了全模态模型的效率瓶颈,为多模态推理在资源受限场景中的部署铺平道路。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com