Perplexity AI 发布 WANDR:评估研究型智能体的开放基准
Perplexity AI 发布 WANDR 基准,用于评估研究型智能体在广泛和深度搜索中的表现。
AI 深度解读
Perplexity AI 推出 WANDR 基准,专门测试研究型智能体在“广而深”的数据收集任务中的表现,填补了现有基准只测单一答案的空白。
- WANDR 全称 Wide ANd Deep Research,包含 500 个真实且具有挑战性的知识工作数据收集任务,要求智能体同时做到“广”(发现大量合格实体)和“深”(为每个实体提供证据支持)。
- 采用可组合的资格键层次结构来定义任务,例如“公司→员工→URL”,每个完整路径独立验证,可表示扁平列表、嵌套搜索或矩阵。
- 具体任务示例:ceo_cfo_appointments 要求至少 70 家美国公司,每家提供一条 CEO/CFO 任命公告页面和一条上市权威页面,共需 140 条有源记录。
- 与 Perplexity 之前的 DRACO 基准互补:DRACO 评估长篇报告的准确性、完整性和客观性,而 WANDR 评估大规模证据集合的构建能力。
- 影响/看点:WANDR 为研究型智能体提供了更贴近实际知识工作的评测标准,有望推动智能体从“单答”向“多证据收集”能力进化。
本内容由 AI 生成,仅供参考,请注意甄别