BM25 大规模制胜:检索增强生成范式的扩展性研究
在28档语料规模上系统对比RAG各范式,发现BM25等词法检索在大规模下反超密集/图/智能体检索
AI 深度解读
一项针对检索增强生成(RAG)不同技术路线的规模化对比研究发现,把语料库规模从小到大跨越约 450 倍后,看似「老派」的 BM25 词法检索最终反超智能体式搜索和图检索,成为大规模场景下的最优默认选择。
- 研究在 28 个严格嵌套的语料规模档位上,固定问题集和参照文档,统一用同一个阅读模型和评判标准,对比词法检索、稠密检索、图索引、智能体式搜索四条路线的准确率与成本
- 语料很小时,文件系统智能体表现最好,但代价高昂——在最小规模下查询 token 消耗就是 BM25 的 39 倍,且随搜索空间变大效果还会下降
- 语料量达到约 1000 万 token 后,BM25 反超智能体式搜索,并在此后所有更大规模档位保持领先,满规模时优势拉开近 20 分
- BM25 不依赖大模型构建索引,同时占据性价比前沿的低成本一端;稠密检索效率尚可但准确率偏低;图检索在达到部署规模之前就先撞上构建成本的墙
- 结论是:语料越大,越应该依赖全局候选排序,智能体式推理更适合放在排序筛选之后精修,而不是替代排序本身
- 对正在搭建大规模 RAG 系统的团队,这提醒了一个反直觉的现实——别急着上复杂的智能体搜索或图检索架构,先把便宜可靠的词法检索用足,往往是更划算的起点。
本内容由 AI 生成,仅供参考,请注意甄别