美团开源 LoHoSearch 评测基准,通过基于知识图谱的自动化出题机制,为搜索智能体提供一个高难度、高区分度的长程搜索能力评估平台。
📝 详细摘要
本文介绍了美团 LongCat 团队推出的 LoHoSearch 评测基准,旨在解决现有 Search Agent 评测集(如 BrowseComp)因人工出题导致难度饱和、区分度下降的问题。LoHoSearch 利用覆盖 762 万实体的知识图谱自动生成题目,通过控制「搜索空间」与「结构复杂度」两个维度制造挑战。评测结果显示,即使是 GPT-5.5 等顶尖模型在 LoHoSearch 上的准确率也大幅下降,揭示了当前模型在长程推理、工具调用效率及上下文管理方面的显著短板,为下一代搜索智能体的研发提供了新的衡量标尺。
💡 主要观点
- 利用知识图谱实现自动化出题,突破人工设计局限。 通过构建包含 762 万实体和 2.65 亿条边的知识图谱,机器能够从全局视角挑选真正具有挑战性的实体和关系,避免了人工出题时因认知局限导致题目偏易的问题。
💬 文章金句
- 能不能让机器自己来出题?
- LoHoSearch 对当前最先进搜索智能体构成了实质挑战。
- 知识图谱是系统化构造高难度题目不可或缺的基础。
📊 文章信息
AI 初评:88
来源:美团 · 技术团队
作者:美团 · 技术团队
分类:人工智能
语言:中文
阅读时间:10 分钟
字数:2330
标签: AI Agent, 搜索智能体, 评测基准, 知识图谱, 长程搜索