KVMEM 方案:通过 KV 状态分页机制实现低延迟百万 Token 级智能体记忆
论文提出 KVMEM 机制,通过分页管理旧 KV 状态,实现低延迟且高效的百万 Token 级智能体记忆。
AI 深度解读
研究人员于2026年9月提出KVMEM记忆管理方案,借鉴操作系统虚拟内存机制将旧KV状态分页存储,为在有限显存设备上运行长轨迹智能体提供了低延迟扩展路径。
- 分页分层存储:根据arXiv预印本(2026-09-22),KVMEM将历史上下文保留为分页KV状态,并在GPU显存、主机内存和NVMe固态硬盘之间实现多层调度,摆脱物理显存对上下文窗口的绝对限制。
- 原生注意力索引:系统利用轻量级注意力空间索引,仅在当前智能体步骤按需换入相关历史块,避免了传统上下文压缩带来的信息丢失与全量预填充开销。
- 基准测试表现:在软件工程长轨迹基准DeepSWE中,配合Qwen3.8-27B模型将任务成功率从压缩基线的43.8%提升至48.4%,且状态恢复速度较传统Compact+RAG方案快11.4至53.8倍。
- 影响/看点:若多层存储的换入换出延迟能在各类消费级硬件上保持稳定,可能使开发者以较低成本在单卡或边缘设备上部署支持百万Token长程记忆的代码与推理智能体。
- 资料依据:
- X:Rohan Paul (@rohanpaul_ai)(2026-09-23):https://x.com/rohanpaul_ai/status/2102572744378585312
- arXiv论文(2026-09-22):https://arxiv.org/abs/2609.04852
本内容由 AI 生成,仅供参考,请注意甄别