SkillSmith:把前缀KV缓存当输入模态,为冻结模型即时生成新技能
Google DeepMind提出SkillSmith,把前缀KV缓存当作输入模态,让冻结的Gemma 3 4B模型无需重训练即可推理时获得新技能。
AI 深度解读
Google DeepMind 提出 SkillSmith,把“给模型新增技能”这件事从重新训练变成了一次前向推理,思路够新,值得细看。
- 核心创新:不再把权重当唯一可学习对象,而是把「前缀 KV 缓存」也当成一种输入模态——模型看到的不只是文本,还能看到一段预先生成的缓存
- 做法:针对冻结不动的 Gemma 3 4B,通过一次前向传播直接生成新的前缀 KV 缓存,相当于给模型“外挂”一段新技能的上下文,不需要微调或重新训练
- 意义:把“技能获取”从离线训练搬到了在线推理阶段,理论上可以按需、实时地给同一个基座模型装配不同能力
- 局限:目前验证限于 4B 规模的 Gemma 3,能否扩展到更大模型、更复杂任务链条,论文本身尚未给出定论
- 看点在于,如果这条路径成立,“权重固定、能力可插拔”会成为部署侧一个很有想象空间的方向——模型分发商可以只发一次权重,后续技能靠传缓存文件来更新,大幅降低适配新任务的成本。
本内容由 AI 生成,仅供参考,请注意甄别