深度解析LLM推理:为什么Transformer只缓存K和V而不缓存Q

📡 马东锡 NLP2026-09-13 09:22

一篇科普长文解析了大模型推理中 KV cache 的机制,说明历史 K/V 需复用而 Q 随新位置即时计算且用完即弃的原因。

AI 深度解读

技术科普内容深入剖析了Transformer自回归推理过程中的KV Cache机制,阐明了模型保留Key与Value而丢弃Query的底层计算与显存优化逻辑。

  • 在自回归单步生成中,注意力机制计算公式为Softmax(Q·K^T / √d)·V,每次仅需最新输入位置计算出的单步Query向量。
  • 当前Query需要与此前所有历史位置的Key进行点积以计算注意力权重,并与Value结合生成上下文表征,因此历史Key和Value必须缓存在显存中以避免重复计算。
  • 历史位置的Query在生成当前token后即完成计算使命,后续生成步骤不会再次读取或复用,因此无须进行持久化缓存。
  • 影响/看点:这一机制解释了LLM推理显存开销随生成序列线性增长的直接原因,也为后续GQA(分组查询注意力)与MLA(多头潜在注意力)等KV Cache显存压缩架构的演进提供了理论依据。
  • 资料依据:
  • X:马东锡 NLP(2026-09-13):https://x.com/dongxi_nlp/status/2098945504289669481

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手