← 回總覽

人类研发时代结束?XYZ 最强 Search Agent 横扫七大榜单,300 个 Agent 跑通 AI4AI 全栈闭环

📅 2026-07-25 12:39 机器之心 人工智能 2 分鐘 1530 字 評分: 87
AI 研究 AI4AI Deep Search Agent 系统 XYZ Aquila
📌 一句话摘要 XYZ AI Lab 发布两款 Deep Search Agent,凭借 AI 驱动的全链路研发闭环在七项基准上刷新 SOTA,展示 AI 参与自身研发的可行路径。 📝 详细摘要 机器之心报道,XYZ AI Lab 发布 35B 参数的 XYZ-Aquila-mini 和 397B 参数的 XYZ-Aquila-pro 两款 Deep Search Agent,在 BrowseComp、BrowseComp-ZH、DeepSearchQA、GAIA、LiveBrowseComp、Humanity's Last Exam 和 WideSearch 七项基准上均取得 SOTA

📌 一句话摘要

XYZ AI Lab 发布两款 Deep Search Agent,凭借 AI 驱动的全链路研发闭环在七项基准上刷新 SOTA,展示 AI 参与自身研发的可行路径。

📝 详细摘要

机器之心报道,XYZ AI Lab 发布 35B 参数的 XYZ-Aquila-mini 和 397B 参数的 XYZ-Aquila-pro 两款 Deep Search Agent,在 BrowseComp、BrowseComp-ZH、DeepSearchQA、GAIA、LiveBrowseComp、Humanity's Last Exam 和 WideSearch 七项基准上均取得 SOTA 成绩。文章重点介绍了这些模型背后的 AI4AI 研发范式:让 AI 参与任务构造、模型训练、运行时优化和评测验证的闭环,通过人定规则、AI 找路、独立评测和全程留痕的机制,实现可验证、可复现的系统性改进。文中还详细说明了上下文管理、研究记事本、状态对齐的监督微调以及强化学习在长程任务中的应用,并指出该体系不仅限于 Deep Search,未来可扩展至 Coding Agent、多工具 Agent 以及法律、医学、科研等场景。

💡 主要观点

- XYZ-Aquila-mini/pro 在七项基准上均刷新 SOTA。 具体成绩为 BrowseComp 78.8、BrowseComp-ZH 82.9、DeepSearchQA 89.5、GAIA 97.1、LiveBrowseComp 48.7、HLE 51.1 和 WideSearch 80.8,覆盖中英文网页、时效信息、深度检索和宽域信息收集。

AI4AI 研发范式实现人定规则、AI 找路、独立评测、全程留痕的闭环。 人类定义目标、评测标准、资源预算和风险边界;Agent 负责问题拆解、方案探索、实验执行和经验整理;独立评测器生成可核验证据,门控机制决定接受、拒绝或升级至人类审查。
上下文管理和研究记事本是解决长程搜索关键问题的两个 AI 提出方向。 AI 从失败轨迹中提出主动上下文整理和独立工作区的研究记事本,团队验证后将其纳入系统,显著提升关键证据保留和答案正确性。
该闭环体系具备泛化潜力,可扩展至 Coding Agent、多工具 Agent 及专业领域工作流。 文章指出,未来可将相同的提出候选方案、执行实验、独立验证、沉淀经验的流程应用于编码、法律、医学、科研和企业等场景,底层闭环保持不变。

💬 文章金句

- 人定规则,AI 找路;独立评测,全程留痕。

  • AI 正在从 '被研发的对象',逐渐成为研发过程中的执行者、实验者和改进者。

📊 文章信息

AI 初评:87

来源:机器之心

作者:机器之心

分类:人工智能

语言:中文

阅读时间:20 分钟

字数:4759

标签: AI 研究, AI4AI, Deep Search, Agent 系统, XYZ Aquila

阅读完整文章

查看原文 → 發佈: 2026-07-25 12:39:00 收錄: 2026-07-25 20:00:04

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。