XYZ AI Lab 发布两款 Deep Search Agent,凭借 AI 驱动的全链路研发闭环在七项基准上刷新 SOTA,展示 AI 参与自身研发的可行路径。
📝 详细摘要
机器之心报道,XYZ AI Lab 发布 35B 参数的 XYZ-Aquila-mini 和 397B 参数的 XYZ-Aquila-pro 两款 Deep Search Agent,在 BrowseComp、BrowseComp-ZH、DeepSearchQA、GAIA、LiveBrowseComp、Humanity's Last Exam 和 WideSearch 七项基准上均取得 SOTA 成绩。文章重点介绍了这些模型背后的 AI4AI 研发范式:让 AI 参与任务构造、模型训练、运行时优化和评测验证的闭环,通过人定规则、AI 找路、独立评测和全程留痕的机制,实现可验证、可复现的系统性改进。文中还详细说明了上下文管理、研究记事本、状态对齐的监督微调以及强化学习在长程任务中的应用,并指出该体系不仅限于 Deep Search,未来可扩展至 Coding Agent、多工具 Agent 以及法律、医学、科研等场景。
💡 主要观点
- XYZ-Aquila-mini/pro 在七项基准上均刷新 SOTA。 具体成绩为 BrowseComp 78.8、BrowseComp-ZH 82.9、DeepSearchQA 89.5、GAIA 97.1、LiveBrowseComp 48.7、HLE 51.1 和 WideSearch 80.8,覆盖中英文网页、时效信息、深度检索和宽域信息收集。
💬 文章金句
- 人定规则,AI 找路;独立评测,全程留痕。
- AI 正在从 '被研发的对象',逐渐成为研发过程中的执行者、实验者和改进者。
📊 文章信息
AI 初评:87
来源:机器之心
作者:机器之心
分类:人工智能
语言:中文
阅读时间:20 分钟
字数:4759
标签: AI 研究, AI4AI, Deep Search, Agent 系统, XYZ Aquila