随机注意力:重新思考高效推理中的 KV Cache 淘汰

📡 HuggingFace Daily Papers2026-09-03 08:00

随机注意力不计算缓存重要性分数,仅保留提示词并随机淘汰KV缓存,性能接近先进方法且吞吐更高。

AI 深度解读

Salesforce AI Research 团队提出 Random Attention 机制,发现针对长链条推理任务的 KV Cache 淘汰无需依赖打分排序,仅需对各注意力头执行均匀随机剔除即可保持精度并显著提升吞吐。

  • 机制精简:摒弃传统基于重要性打分保留高分 token 的复杂算法,该方案完整保留 Prompt,而在各注意力头内部对长推理链 KV Cache 进行均匀随机淘汰。
  • 性能表现:在 4 个模型与 6 项推理任务测试中,Random Attention 的推理精度与最强打分淘汰方法相当,并在 vLLM 部署中实现了 32% 至 43% 的吞吐量提升。
  • 冗余性成因:实验表明 Prompt 是缓存的关键部分,而推理链本身在文本层面(逐步重述所需信息)与多头注意力层面(各头独立保留副本)具备多重冗余,使随机抽取能够保留足够有效信息。
  • 影响/看点:该方法去除了缓存打分计算的运行时开销,简化了推理引擎的内存管理设计,但该结论的前提是模型存在长思维链冗余,在缺乏上下文重述的精简任务中可能存在信息丢失的局限。
  • 资料依据:
  • arXiv 论文预印本(2026-09-03):https://arxiv.org/abs/2609.03430
  • GitHub 官方代码仓(2026-09-03):https://github.com/SalesforceAIResearch/Random-Attention

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手