Perplexity AI 开源了基准测试 Wandr,用于评估 AI 智能体在广而深的研究型信息工作中的能力。
📝 详细摘要
Geek 分享了 Perplexity AI 开源的一个名为 Wandr 的基准测试。该测试专门用于衡量 AI 智能体在处理复杂研究任务时的表现,这些任务涉及大规模信息发现、信息丰富化、关键信息抽取、实体消歧和证据合成等多个环节,旨在评估 AI 进行深度研究的能力。
📊 文章信息
AI 初评:80
来源:Geek(@geekbb)
作者:Geek
分类:人工智能
语言:中文
阅读时间:1 分钟
字数:116
标签: AI 基准测试, Perplexity AI, 开源, AI 研究, GitHub