规模化记忆解码器:预训练参数化长期记忆
Memory Decoder扩展至69亿参数、3000亿token预训练,用分布式Faiss索引解决大规模检索式记忆的成本瓶颈
AI 深度解读
一项研究把「记忆解码器」这一独立记忆模块扩展到 69 亿参数规模、并用 3000 亿 token 预训练,验证了给语言模型外挂一个专门的长期记忆组件,比单纯堆大模型本体参数更划算。
- 现有解码器模型把长期记忆和推理能力混在同一套参数里,导致记忆容量无法独立扩展;该研究将记忆单独做成可插拔模块
- 规模一大,标准 Faiss 检索索引方案直接跑不动,团队专门搭建了分布式索引与检索管线,并对近邻分布做稀疏分批加载来解决瓶颈
- 在 17 个基准上,给 4.1 亿参数的 Pythia-410M 配上 69 亿参数的通用记忆模块后,平均分从 29.86 提升到 37.34,反超参数量大得多的 Pythia-12B(37.24),且总参数还少 39%
- 对 0.6B 到 140 亿参数的 Qwen3 Base 系列,配上 17 亿参数的领域记忆模块后,三个测试领域的平均分在每个规模档位都提升超过 9 分
- 结果表明,独立扩展记忆参数比单纯扩大基座模型本体,是一条更省参数、更高效的性能提升路径
- 这为「小模型配大记忆」的低成本部署路线提供了实证支持,尤其适合需要垂直领域知识但算力有限的场景。
本内容由 AI 生成,仅供参考,请注意甄别