ICML 2026 Oral 论文 CausalGame 揭示,30 款前沿 LLM Agent 在因果推理上普遍失效,凸显 AI Scientist 仍缺乏真正科学发现能力。
📝 详细摘要
文章介绍了由 MBZUAI、卡内基梅隆大学等机构提出的 CausalGame 基准,该基准通过结构因果模型(SCM)驱动的交互式游戏评估 LLM Agent 在因果推理、实验设计和机制解释方面的能力。评测覆盖 OpenAI、Anthropic、Google 等 30 种前沿模型,结果显示所有模型在 Agentic 模式下的平均生存率仅在 59%-68% 之间,远低于获胜线(75%-85%),因果推理得分普遍偏低。文章进一步分析了失败模式,指出模型往往陷入盲目探索、表面分析或依赖环境信息泄漏的“作弊”行为,而非真正建立因果模型。文章强调,未来 AI Scientist 的发展需要单独评估和训练其因果思维能力,才能从自动化科研流程迈向真正的科学发现。
💡 主要观点
- CausalGame 通过结构因果模型构建交互式游戏,专门考察 LLM Agent 在因果推理、实验设计和机制解释上的能力。 该基准涵盖自动评测、实验设计、多轮交互、因果关系、解释评估和观测陷阱六个维度,旨在测试 agent 是否能在存在选择偏差、测量误差和隐藏混淆的环境中识别真实因果机制。
💬 文章金句
- 一个无法区分相关与因果的 AI Scientist,在面对隐藏混淆、选择偏差和测量噪声时,很容易被观测信号带偏,甚至给出会造成严重后果的错误结论。
- CausalGame 的核心设计是把结构因果模型(SCM)[1,2] 当作每个场景的“引擎”。
- 发现一&二:目前的 Frontier LLM 普遍欠缺因果思维能力。
- 发现三:只有因果推理能防住‘探索过拟合’。
- 失败模式:问题不在不会用数据,而在没有形成因果模型
📊 文章信息
AI 初评:78
来源:PaperWeekly
作者:PaperWeekly
分类:人工智能
语言:中文
阅读时间:26 分钟
字数:6387
标签: AI Scientist, 因果推理, CausalGame, ICML 2026, LLM Agent