← 回總覽

下一代搜索智能体评测基准!美团开源 LoHoSearch,用知识图谱校准 AI 能力认知

📅 2026-07-27 10:22 美团 · 技术团队 人工智能 2 分鐘 1262 字 評分: 88
AI Agent 搜索智能体 评测基准 知识图谱 长程搜索
📌 一句话摘要 美团开源 LoHoSearch 评测基准,通过基于知识图谱的自动化出题机制,为搜索智能体提供一个高难度、高区分度的长程搜索能力评估平台。 📝 详细摘要 本文介绍了美团 LongCat 团队推出的 LoHoSearch 评测基准,旨在解决现有 Search Agent 评测集(如 BrowseComp)因人工出题导致难度饱和、区分度下降的问题。LoHoSearch 利用覆盖 762 万实体的知识图谱自动生成题目,通过控制「搜索空间」与「结构复杂度」两个维度制造挑战。评测结果显示,即使是 GPT-5.5 等顶尖模型在 LoHoSearch 上的准确率也大幅下降,揭示了当前模型在

📌 一句话摘要

美团开源 LoHoSearch 评测基准,通过基于知识图谱的自动化出题机制,为搜索智能体提供一个高难度、高区分度的长程搜索能力评估平台。

📝 详细摘要

本文介绍了美团 LongCat 团队推出的 LoHoSearch 评测基准,旨在解决现有 Search Agent 评测集(如 BrowseComp)因人工出题导致难度饱和、区分度下降的问题。LoHoSearch 利用覆盖 762 万实体的知识图谱自动生成题目,通过控制「搜索空间」与「结构复杂度」两个维度制造挑战。评测结果显示,即使是 GPT-5.5 等顶尖模型在 LoHoSearch 上的准确率也大幅下降,揭示了当前模型在长程推理、工具调用效率及上下文管理方面的显著短板,为下一代搜索智能体的研发提供了新的衡量标尺。

💡 主要观点

- 利用知识图谱实现自动化出题,突破人工设计局限。 通过构建包含 762 万实体和 2.65 亿条边的知识图谱,机器能够从全局视角挑选真正具有挑战性的实体和关系,避免了人工出题时因认知局限导致题目偏易的问题。

通过搜索空间与结构复杂度双维度量化难度。 LoHoSearch 将难度定义为候选实体的数量(搜索空间)和锁定答案所需的条件链条长度(结构复杂度),并设计树结构和图结构子图来分别增强这两类难度。
揭示当前顶尖模型在复杂搜索任务中的性能瓶颈。 GPT-5.5 等模型在 LoHoSearch 上的准确率远低于在 BrowseComp 上的表现,且工具调用次数显著增加,证明了模型在处理长程搜索和答案置信度校准上的不足。
现有上下文管理策略在极高难度任务下收益递减。 消融实验表明,传统的轨迹压缩或重启策略在 LoHoSearch 上的提升幅度远低于简单基准,说明长程搜索中的信息丢失问题需要更深层的技术突破。

💬 文章金句

- 能不能让机器自己来出题?

  • LoHoSearch 对当前最先进搜索智能体构成了实质挑战。
  • 知识图谱是系统化构造高难度题目不可或缺的基础。

📊 文章信息

AI 初评:88

来源:美团 · 技术团队

作者:美团 · 技术团队

分类:人工智能

语言:中文

阅读时间:10 分钟

字数:2330

标签: AI Agent, 搜索智能体, 评测基准, 知识图谱, 长程搜索

阅读完整文章

查看原文 → 發佈: 2026-07-27 10:22:05 收錄: 2026-07-27 12:00:58

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。