Perplexity 推出 Q2D-Web 基准测试与排行榜,评估智能体 RAG 网页检索能力
Perplexity 推出 Q2D-Web 基准与公开排行榜,用于评估智能体 RAG 架构下重构查询的大规模网页检索能力。
AI 深度解读
Perplexity 发布了针对智能体检索增强生成(Agentic RAG)系统的专用基准测试与公开排行榜 Q2D-Web(Query2Doc-Web),旨在评估文本嵌入向量模型在大规模真实网页检索中的性能。
- 评估场景真实化:不同于传统的静态问答检索测试,Q2D-Web 侧重评估嵌入模型在处理由智能体自适应重构的搜索查询时的匹配精度。
- 面向大规模网页环境:基准测试基于真实复杂的 Web 搜索语料,考察向量模型在海量异构网页内容中的召回率与排序表现。
- 设立公开排行榜:提供标准化的评测协议与开放榜单,促进行业对智能体 RAG 中间检索层性能的量化对比与迭代。
- 针对性解决检索瓶颈:针对智能体多轮拆解、动态改写查询导致传统检索模型效果下降的问题提供评估工具。
- 影响/看点:该基准若被学术界与工业界广泛采纳,将为智能体 RAG 系统的向量表征与检索模块建立更贴近实际搜索工况的评价参考标准。
- 资料依据:
- Perplexity(2026-09-09):https://x.com/perplexity_ai/status/2097782467210166601
- Perplexity(2026-09-09):https://www.perplexity.ai/hub/blog/q2d-web
本内容由 AI 生成,仅供参考,请注意甄别