NaceAI 提出超网络方法:无需修改参数即可为模型注入新知识
NaceAI提出超网络方法,通过低秩矩阵为大模型注入新知识而无需修改原参数,模型越大更新泛化效果越好。
AI 深度解读
AI 研究团队 NaceAI 提出一种超网络方法,让一个较小的模型学会为另一个大模型生成“知识更新”,从而在不修改后者数十亿参数的前提下为其注入新知识,为大模型的知识更新提供了一条更轻量的技术路径。
- 核心思路是用超网络生成低秩矩阵,以此对目标模型的内部计算进行“重定向”,而非直接改写原始参数
- 知识注入被设计成一个可复用流程:同一套超网络生成机制理论上可以反复用于不同批次的知识更新
- 实验显示,目标模型规模越大,超网络生成的更新泛化效果越好,说明该方法可能与当前大模型的规模化趋势天然契合
- 相比全参数微调或持续预训练,这种方式绕开了大模型更新成本高、易遗忘旧知识的老问题
- 看点:如果这一思路能在更大规模场景下验证,大模型的“知识过期”问题或许不再需要昂贵的重新训练来解决,而是像插拔模块一样按需更新,值得关注后续开源实现和第三方复现。
本内容由 AI 生成,仅供参考,请注意甄别