利用 LFM2.5-VL-DSpark 加速视觉语言模型推理

📡 Hugging Face Blog2026-09-24 22:08

研究团队推出LFM2.5-VL-DSpark技术方案,有效优化了视觉语言模型的计算架构与推理效率。

AI 深度解读

Liquid AI 在 Hugging Face 博客发布了专为视觉语言模型设计的推测解码方案 LFM2.5-VL-DSpark,旨在降低多模态模型在边缘设备与云端 GPU 上的推理延迟。

  • 该方案采用 4 层纯注意力草稿模型,仅增加 2.8 亿参数(占 3B 目标模型参数量的 8.9%),在共享隐藏层表征上预测候选 token。
  • 在苹果 M5 Max 芯片上结合 MLX 框架测试,解码速度提升至 2.30 至 3.13 倍,端到端延迟降低至 1.56 至 2.62 倍。
  • 在云端英伟达 H100 GPU 平台上,解码速率提升 2.04 至 2.66 倍,端到端性能提升 1.64 至 2.27 倍。
  • 该草稿模型在发布首日即适配了 llama.cpp、MLX-VLM 与 SGLang 等开源推理引擎。
  • 影响/看点:这意味着轻量化推测解码技术在多模态领域的工程成熟度有所提高,若能在不同任务场景中保持稳定的 token 接受率,将有助于降低边缘设备部署多模态模型的算力成本。
  • 资料依据:
  • Hugging Face Blog(2026-09-24):https://huggingface.co/blog/LiquidAI/lfm2-5-vl-dspark

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手