谷歌与 KAIST 提出声明式注意力机制:自主筛选上下文将注意力开销降低 52%
谷歌与 KAIST 提出声明式注意力机制,让模型自主声明并筛选所需上下文,使注意力开销降低 52%。
AI 深度解读
韩国科学技术院(KAIST)与谷歌 DeepMind 研究团队于 2026 年 9 月 3 日在 arXiv 发布论文(arXiv:2609.02737),提出一种名为声明式注意力(Declarative Attention, DA)的机制,为长文本解码阶段的显存开销优化提供了新思路。
- 机制设计:模型在思维链生成过程中自主输出模式声明标签,划分为读取全上下文的 〈global〉、聚焦指定局部的 〈focus〉 以及仅查看近期输出的 〈local〉 三种状态。
- 无外置模块的缓存跳过:推理引擎直接解析模型生成的模式标签,按需跳过 KV cache 中不相关区域的数据搬运,无需额外训练外置评分器或启发式筛选器。
- 实验数据:在涵盖 Gemma-4-31B 与 Qwen-3.6-27B 的 15 项长文本任务零样本评测中,DA 将注意力解码过程中的 token 读取量降低了 31.1% 至 52.0%,模型综合准确率仅出现 1.27 至 2.75 个百分点的窄幅波动。
- 影响/看点:该方法表明模型自身具备自主调控注意力范围的潜力,若进一步与底层推理引擎深度结合,可能在长上下文场景中显著减少显存带宽瓶颈,但其实际加速效果仍取决于推理框架对动态稀疏访存的硬件适配成熟度。
- 资料依据:
- arXiv 论文(2026-09-03):https://arxiv.org/abs/2609.02737
- X:Rohan Paul(2026-09-05):https://x.com/rohanpaul_ai/status/2096074134287786223
本内容由 AI 生成,仅供参考,请注意甄别