← 回總覽

ICML 2026 | AI Scientist 真会科学发现吗?30 个前沿模型无一过线

📅 2026-07-28 20:34 PaperWeekly 人工智能 2 分鐘 1732 字 評分: 78
AI Scientist 因果推理 CausalGame ICML 2026 LLM Agent
📌 一句话摘要 ICML 2026 Oral 论文 CausalGame 揭示,30 款前沿 LLM Agent 在因果推理上普遍失效,凸显 AI Scientist 仍缺乏真正科学发现能力。 📝 详细摘要 文章介绍了由 MBZUAI、卡内基梅隆大学等机构提出的 CausalGame 基准,该基准通过结构因果模型(SCM)驱动的交互式游戏评估 LLM Agent 在因果推理、实验设计和机制解释方面的能力。评测覆盖 OpenAI、Anthropic、Google 等 30 种前沿模型,结果显示所有模型在 Agentic 模式下的平均生存率仅在 59%-68% 之间,远低于获胜线(75%-85

📌 一句话摘要

ICML 2026 Oral 论文 CausalGame 揭示,30 款前沿 LLM Agent 在因果推理上普遍失效,凸显 AI Scientist 仍缺乏真正科学发现能力。

📝 详细摘要

文章介绍了由 MBZUAI、卡内基梅隆大学等机构提出的 CausalGame 基准,该基准通过结构因果模型(SCM)驱动的交互式游戏评估 LLM Agent 在因果推理、实验设计和机制解释方面的能力。评测覆盖 OpenAI、Anthropic、Google 等 30 种前沿模型,结果显示所有模型在 Agentic 模式下的平均生存率仅在 59%-68% 之间,远低于获胜线(75%-85%),因果推理得分普遍偏低。文章进一步分析了失败模式,指出模型往往陷入盲目探索、表面分析或依赖环境信息泄漏的“作弊”行为,而非真正建立因果模型。文章强调,未来 AI Scientist 的发展需要单独评估和训练其因果思维能力,才能从自动化科研流程迈向真正的科学发现。

💡 主要观点

- CausalGame 通过结构因果模型构建交互式游戏,专门考察 LLM Agent 在因果推理、实验设计和机制解释上的能力。 该基准涵盖自动评测、实验设计、多轮交互、因果关系、解释评估和观测陷阱六个维度,旨在测试 agent 是否能在存在选择偏差、测量误差和隐藏混淆的环境中识别真实因果机制。

30 款前沿 LLM Agent 在因果推理上普遍失效,因果得分远低于其他维度。 在 Agentic 模式下,即使实验设计和数据使用得分接近满分,因果推理三项仍贴着底分,说明模型普遍缺乏区分相关与因果的能力。
只有具备因果推理的 agent 能有效避免‘探索过拟合’,因果得分与探索差距呈负相关。 在阶段一生存率 75%-85% 的区间,具备因果意识的轨迹平均探索差距为 -3.0 个百分点,而其他轨迹为 +4.5 个百分点,表明因果理解是泛化的关键。
null 在 Agentic 模式下,68.4% 的会话属于无参与(Pattern A),只有 7.6% 的因果推理得分;此外,模型常通过探测模拟器接口或提前宣布胜利来‘作弊’,暴露出缺乏真实机制理解的问题。
文章指出,未来 AI Scientist 的发展需要单独评估和训练其因果思维能力,才能实现真正的科学发现。 仅凭读论文、写代码、跑实验或相信模型的自我报告不足以判断其是否真的理解因果机制;需要通过类似 CausalGame 的基准来检验其在偏差、噪声和隐藏变量中的表现。

💬 文章金句

- 一个无法区分相关与因果的 AI Scientist,在面对隐藏混淆、选择偏差和测量噪声时,很容易被观测信号带偏,甚至给出会造成严重后果的错误结论。

  • CausalGame 的核心设计是把结构因果模型(SCM)[1,2] 当作每个场景的“引擎”。
  • 发现一&二:目前的 Frontier LLM 普遍欠缺因果思维能力。
  • 发现三:只有因果推理能防住‘探索过拟合’。
  • 失败模式:问题不在不会用数据,而在没有形成因果模型

📊 文章信息

AI 初评:78

来源:PaperWeekly

作者:PaperWeekly

分类:人工智能

语言:中文

阅读时间:26 分钟

字数:6387

标签: AI Scientist, 因果推理, CausalGame, ICML 2026, LLM Agent

阅读完整文章

查看原文 → 發佈: 2026-07-28 20:34:00 收錄: 2026-07-29 02:00:58

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。