KVMEM 方案:通过 KV 状态分页机制实现低延迟百万 Token 级智能体记忆

📡 Rohan Paul2026-09-23 09:36

论文提出 KVMEM 机制,通过分页管理旧 KV 状态,实现低延迟且高效的百万 Token 级智能体记忆。

AI 深度解读

研究人员于2026年9月提出KVMEM记忆管理方案,借鉴操作系统虚拟内存机制将旧KV状态分页存储,为在有限显存设备上运行长轨迹智能体提供了低延迟扩展路径。

  • 分页分层存储:根据arXiv预印本(2026-09-22),KVMEM将历史上下文保留为分页KV状态,并在GPU显存、主机内存和NVMe固态硬盘之间实现多层调度,摆脱物理显存对上下文窗口的绝对限制。
  • 原生注意力索引:系统利用轻量级注意力空间索引,仅在当前智能体步骤按需换入相关历史块,避免了传统上下文压缩带来的信息丢失与全量预填充开销。
  • 基准测试表现:在软件工程长轨迹基准DeepSWE中,配合Qwen3.8-27B模型将任务成功率从压缩基线的43.8%提升至48.4%,且状态恢复速度较传统Compact+RAG方案快11.4至53.8倍。
  • 影响/看点:若多层存储的换入换出延迟能在各类消费级硬件上保持稳定,可能使开发者以较低成本在单卡或边缘设备上部署支持百万Token长程记忆的代码与推理智能体。
  • 资料依据:
  • X:Rohan Paul (@rohanpaul_ai)(2026-09-23):https://x.com/rohanpaul_ai/status/2102572744378585312
  • arXiv论文(2026-09-22):https://arxiv.org/abs/2609.04852

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手