[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"aihot-art-93168":3},{"itemId":4,"vertical":5,"category":6,"source":7,"score":8,"title":9,"summary":10,"analysis":11,"url":12,"coverUrl":13,"direction":13,"marketSignal":13,"publishedAt":14},"93168","ai","论文研究","MarkTechPost",65,"Perplexity AI 发布 WANDR：评估研究型智能体的开放基准","Perplexity AI 发布 WANDR 基准，用于评估研究型智能体在广泛和深度搜索中的表现。","Perplexity AI 推出 WANDR 基准，专门测试研究型智能体在“广而深”的数据收集任务中的表现，填补了现有基准只测单一答案的空白。\n· WANDR 全称 Wide ANd Deep Research，包含 500 个真实且具有挑战性的知识工作数据收集任务，要求智能体同时做到“广”（发现大量合格实体）和“深”（为每个实体提供证据支持）。\n· 采用可组合的资格键层次结构来定义任务，例如“公司→员工→URL”，每个完整路径独立验证，可表示扁平列表、嵌套搜索或矩阵。\n· 具体任务示例：ceo_cfo_appointments 要求至少 70 家美国公司，每家提供一条 CEO\u002FCFO 任命公告页面和一条上市权威页面，共需 140 条有源记录。\n· 与 Perplexity 之前的 DRACO 基准互补：DRACO 评估长篇报告的准确性、完整性和客观性，而 WANDR 评估大规模证据集合的构建能力。\n影响\u002F看点：WANDR 为研究型智能体提供了更贴近实际知识工作的评测标准，有望推动智能体从“单答”向“多证据收集”能力进化。","https:\u002F\u002Fwww.marktechpost.com\u002F2026\u002F07\u002F19\u002Fperplexity-ai-releases-wandr-an-open-benchmark-evaluating-research-agents-that-must-search-wide-and-deep\u002F",null,"2026-07-19 15:19:14"]