深度解析LLM推理:为什么Transformer只缓存K和V而不缓存Q
一篇科普长文解析了大模型推理中 KV cache 的机制,说明历史 K/V 需复用而 Q 随新位置即时计算且用完即弃的原因。
AI 深度解读
技术科普内容深入剖析了Transformer自回归推理过程中的KV Cache机制,阐明了模型保留Key与Value而丢弃Query的底层计算与显存优化逻辑。
- 在自回归单步生成中,注意力机制计算公式为Softmax(Q·K^T / √d)·V,每次仅需最新输入位置计算出的单步Query向量。
- 当前Query需要与此前所有历史位置的Key进行点积以计算注意力权重,并与Value结合生成上下文表征,因此历史Key和Value必须缓存在显存中以避免重复计算。
- 历史位置的Query在生成当前token后即完成计算使命,后续生成步骤不会再次读取或复用,因此无须进行持久化缓存。
- 影响/看点:这一机制解释了LLM推理显存开销随生成序列线性增长的直接原因,也为后续GQA(分组查询注意力)与MLA(多头潜在注意力)等KV Cache显存压缩架构的演进提供了理论依据。
- 资料依据:
- X:马东锡 NLP(2026-09-13):https://x.com/dongxi_nlp/status/2098945504289669481
本内容由 AI 生成,仅供参考,请注意甄别