KVCMAS:多智能体系统共享上下文的高效 KV 缓存修正机制

📡 HuggingFace Daily Papers2026-09-28 08:00

论文针对多智能体共享上下文的重复预填充与前缀差异问题,提出高效KV缓存修正机制KVCMAS,大幅降低计算与显存开销。

AI 深度解读

研究团队提出面向多智能体系统共享上下文的高效 KV 缓存在线修正框架 KVCMAS,以降低多角色协作中重复 Prefill 带来的算力与显存消耗。

  • 在提示词定制的多智能体系统中,各智能体专属前缀导致相同共享上下文生成的 KV 缓存产生偏差,造成重复前向计算与显存冗余。
  • KVCMAS 利用紧凑的低秩状态表征跨智能体缓存偏差,在工作流中无缝链式传递修正,无需在智能体外部构建额外的参考缓存。
  • 该设计保持了首个智能体缓存的精确性,同时支持动态变化的共享上下文流转。
  • 在语言和视语言任务测试中,KVCMAS 在高并发场景下降低了首 Token 时间(TTFT),受控测试下相比无缓存共享实现 2.0 倍 TTFT 加速,并比以往修正方法降低高达 3.7 倍的 GPU 峰值显存。
  • 影响/看点:该机制意味着提示词驱动的多智能体服务系统可以在高并发协作中显著降低硬件成本与响应延迟,其优势在复杂多轮长上下文场景中更为突出。
  • 资料依据:
  • arXiv(2026-09-28):https://arxiv.org/abs/2609.34060
  • Hugging Face(2026-09-28):https://huggingface.co/papers/2609.34060

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手