规模化记忆解码器:预训练参数化长期记忆

📡 HuggingFace Daily Papers2026-07-30 08:00

Memory Decoder扩展至69亿参数、3000亿token预训练,用分布式Faiss索引解决大规模检索式记忆的成本瓶颈

AI 深度解读

一项研究把「记忆解码器」这一独立记忆模块扩展到 69 亿参数规模、并用 3000 亿 token 预训练,验证了给语言模型外挂一个专门的长期记忆组件,比单纯堆大模型本体参数更划算。

  • 现有解码器模型把长期记忆和推理能力混在同一套参数里,导致记忆容量无法独立扩展;该研究将记忆单独做成可插拔模块
  • 规模一大,标准 Faiss 检索索引方案直接跑不动,团队专门搭建了分布式索引与检索管线,并对近邻分布做稀疏分批加载来解决瓶颈
  • 在 17 个基准上,给 4.1 亿参数的 Pythia-410M 配上 69 亿参数的通用记忆模块后,平均分从 29.86 提升到 37.34,反超参数量大得多的 Pythia-12B(37.24),且总参数还少 39%
  • 对 0.6B 到 140 亿参数的 Qwen3 Base 系列,配上 17 亿参数的领域记忆模块后,三个测试领域的平均分在每个规模档位都提升超过 9 分
  • 结果表明,独立扩展记忆参数比单纯扩大基座模型本体,是一条更省参数、更高效的性能提升路径
  • 这为「小模型配大记忆」的低成本部署路线提供了实证支持,尤其适合需要垂直领域知识但算力有限的场景。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com