PReCache:基于低秩预计算与中性重构的 Multi-LoRA 智能体 KV 缓存共享
论文提出免训练缓存共享框架PReCache,通过低秩预计算与中性重构消除Multi-LoRA智能体间的重复计算与干扰。
AI 深度解读
研究人员提出免训练的 Multi-LoRA 智能体 KV 缓存共享框架 PReCache,旨在消除多适配器智能体共享基座模型时的重复 Prefill 计算并保障角色特化表现。
- 现有 Multi-LoRA 智能体直接复用缓存会导致当前智能体依赖前一个智能体的适配器表征,削弱自身 LoRA 的角色特异性。
- PReCache 包含 PreLRShared 和 ReBaseShared 两种设计:前者在首次处理共享上下文时预计算各智能体专属的低秩缓存以消除重复 Prefill;后者从中性隐藏状态重构共享基座缓存以降低表征误差。
- 针对单流推理和并发服务场景分别定制了推断调度方案,在各智能体轮次交替时或执行过程中进行重构。
- 测试显示 PreLRShared 实现了最高 3.1 倍的 TTFT 加速和 2.3 倍的每请求吞吐提升;ReBaseShared 平均准确率仅比无缓存共享下降 1.1 分,在各共享方法中保持了较高的准确度。
- 影响/看点:该框架意味着共享基座的 Multi-LoRA 多智能体系统能在几乎不损失角色特化能力的前提下实现低延迟推理,适合部署于长周期复杂智能体工作流。
- 资料依据:
- arXiv(2026-09-28):https://arxiv.org/abs/2609.34054
- Hugging Face(2026-09-28):https://huggingface.co/papers/2609.34054
本内容由 AI 生成,仅供参考,请注意甄别