Aioga
AI资讯 / 论文研究
返回 AI资讯

Perplexity 发布开放基准 WANDR,评估智能体的广泛搜索与深度验证能力

MarkTechPost(RSS)Aioga 编辑团队2026-07-19T07:19:14.000Z热度 37

Perplexity 发布开放基准 WANDR,包含 500 个真实数据收集任务,要求智能体同时完成广泛发现与深度验证。其自有的 Search as Code 系统以 0.36...

论文研究MarkTechPost(RSS)

今日 AI 情报摘要

Perplexity 发布开放基准 WANDR,包含 500 个真实数据收集任务,要求智能体同时完成广泛发现与深度验证。

其自有的 Search as Code 系统以 0.363 的 Soft F1 领先,但所有系统均远未解决该基准,最高分仅 0.447。

中文正文 · AI 翻译

研究代理如今已经处理真正的知识工作。各队将竞争性地图绘制、尽职调查和文献综述委托给他们。然而,大多数基准测试的是单一答案,而非大规模的证据支持的收集。Perplexity通过新的开放基准针对这一差距。

Perplexity 发布了 WANDR(广泛 ANd 深度研究):https://github.com/perplexityai/wandr。它是一个开放的基准和评估工具。它围绕500个现实且具有挑战性的数据收集任务构建,用于知识工作。WANDR是Perplexity的DRACO深度研究基准的“广义兄弟”。DRACO询问代理人是否能产出准确、完整、客观的长篇报告。WANDR则询问是否能建立一个有证据的大型收藏。

从核心上讲,WANDR共同测试了两个需求。广义意味着发现一大类且通常开放的合格实体。深度意味着对每个实体进行足够的调查,以提供证据支持每个说法。两者结合后,代理的问题就不同了。仅凭几个有说服力的例子是不够的。建立在不完整研究基础上的精致叙述同样不足。

为了捕捉这一点,WANDR使用可组合的资格密钥层级结构。一个任务可能会请求公司(n) -> employee(m) -> url(k)。这意味着n家合格公司,每家有m名员工,每家有k页支持。树中每一条完整路径都会被独立验证。相同的结构可以表示平面列表、嵌套搜索或矩阵。

为了建立这种层级结构,考虑已释放的ceo_cfo_appointments任务。它要求至少有70家美国公司。每位职位必须在2026年3月1日至4月30日期间首次公布首席执行官或首席财务官任命。每个人,代理会提供一个权威的预约页面。子任务为每家公司添加一个列表权威页面。该任务合计需要140条源代码支持的记录。

具体来说,这两个层级和一份提交的记录如下:

除了单个示例,WANDR的任务还基于真实使用。它从制作中出现的去识别模式开始,而非合成提示。半自动化的管道将这些模式转化为任务。流程分为四个阶段:播种、创作、录取和策展。它采用了交错的作者-评论循环和机械式的线条。

因此,中位任务需要 50 名成员和总共 245 条记录。在所有 500 个任务中,WANDR 需要 170,495 条有来源支持的记录。任务分为 167 个低难度、166 个中等难度和 167 个高难度。难度取决于每条记录的工作量,而不仅仅是规模。

与固定答案键不同,WANDR 根据引用的证据对每个声明进行评分。每条记录包含一个条目、URL、选择的摘录和答案。评分者在评估过程中会重新获取页面。它会检查页面是否可用且在范围内,然后验证摘录是否真实出现并支持每个要求。

这些二进制记录判定随后在层级中汇总。精确度衡量系统提交内容的质量。召回率衡量质量调整后的完成度,任何不足部分以零计入。软评分为不完整的成员给予部分积分。硬评分仅计算其完整子树正确的成员。

使用这种方法,Perplexity 在所有 500 个任务上运行了六个生产系统。其自有的“代码搜索”(Search as Code,SaC)系统领先。然而,没有任何系统接近解决该基准。

经过更多努力,Perplexity 在 xhigh 设置下达到 0.447 的软 F1 分数。各设置的成本跨度超过四个数量级,从每个任务 0.03 美元到 324.83 美元不等。

在排行榜之外,有四个发现尤为突出。首先,部分进展很常见,但完全覆盖很少。每个系统的软召回均低于软精度。其次,规模会大幅加剧问题。更深的层级最为不利,因为每个分支都会增加失败点。第三,发现是第一个结构性瓶颈。各系统顶层发现完成率为 0.611 到 0.951。遗漏的数量主要由交付不足而非重复合并导致。第四,找到可用页面通常很容易,将其转化为完整证据才是难点。对于 Perplexity,41.4% 的页面缺少实质性要求。此外,57.5% 的摘录未能支持完整声明。在仅检索检查下,其软 F1 为 0.531,而在完整判定下降至 0.363。

值得注意的是,“代码搜索”非常适合该任务结构。代理可以将检索、筛选、分支、连接、去重和停止逻辑表现为程序,然后由确定性计算处理模型上下文之外的重复操作。

实际上,WANDR 对应于团队已经自动化的工作。市场分析师需要每一个符合条件的竞争对手,并为每一个提供匹配的证据。尽职调查团队需要数十家公司,然后是所有权、管理层和融资信息。人才招聘需要许多候选人,每个候选人都有支持的资料页面。WANDR 在专业规模上正是测试这些广而深的收集模式。

因为评分是按记录进行的,团队可以精确定位失败的地方。评分树将损失隔离到发现、补充或证据提取环节。这种诊断帮助工程师一次改进一个薄弱环节。

需要与我们合作推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等吗?请与我们联系:https://forms.gle/wbash1wF6efRj8G58

Perplexity 发布开放基准 WANDR,评估智能体的广泛搜索与深度验证能力

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位具有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的努力是推出人工智能媒体平台 Marktechpost,该平台以深入覆盖机器学习和深度学习新闻而脱颖而出,这些新闻既有技术深度,又易于广大受众理解。该平台拥有超过每月两百万的浏览量,显示其在受众中的受欢迎程度。

10 Open-Source No-Code Platforms for Building LLM Apps, RAG Systems, and AI Agents
Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2
Fine-Tuning Qwen3 with LoRA Using NVIDIA NeMo AutoModel
NVIDIA Released DeepStream 9.1

构建一个有代理功能的活动场地运营商 [完整代码]:https://pxllnk.co/twdn5

谢谢!我们的团队将很快与您联系

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Perplexity 发布开放基准 WANDR,包含 500 个真实数据收集任务,要求智能体同时完成广泛发现与深度验证。 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-19T07:19:14.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Perplexity 发布开放基准 WANDR,包含 500 个真实数据收集任务,要求智能体同时完成广泛发现与深度验证。其自有的 Search as Code 系统以 0.36...

MarkTechPost(RSS)2026-07-19T07:19:14.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。