SkillSmith:把前缀KV缓存当输入模态,为冻结模型即时生成新技能

📡 Rohan Paul2026-08-03 04:38

Google DeepMind提出SkillSmith,把前缀KV缓存当作输入模态,让冻结的Gemma 3 4B模型无需重训练即可推理时获得新技能。

AI 深度解读

Google DeepMind 提出 SkillSmith,把“给模型新增技能”这件事从重新训练变成了一次前向推理,思路够新,值得细看。

  • 核心创新:不再把权重当唯一可学习对象,而是把「前缀 KV 缓存」也当成一种输入模态——模型看到的不只是文本,还能看到一段预先生成的缓存
  • 做法:针对冻结不动的 Gemma 3 4B,通过一次前向传播直接生成新的前缀 KV 缓存,相当于给模型“外挂”一段新技能的上下文,不需要微调或重新训练
  • 意义:把“技能获取”从离线训练搬到了在线推理阶段,理论上可以按需、实时地给同一个基座模型装配不同能力
  • 局限:目前验证限于 4B 规模的 Gemma 3,能否扩展到更大模型、更复杂任务链条,论文本身尚未给出定论
  • 看点在于,如果这条路径成立,“权重固定、能力可插拔”会成为部署侧一个很有想象空间的方向——模型分发商可以只发一次权重,后续技能靠传缓存文件来更新,大幅降低适配新任务的成本。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com