← 回總覽

顶级 AI 撞上低级乌龙:连写几十页推导,结果发现题干错了?

📅 2026-05-04 12:04 新智元 人工智能 2 分鐘 1533 字 評分: 82
DeepMind Aletheia 数学证明 AI 局限 潜意识剽窃
📌 一句话摘要 本文以 DeepMind 的 Aletheia 系统攻克埃尔德什猜想为例,深入剖析了 AI 在数学证明中的能力与局限,揭示了「潜意识剽窃」和「逻辑狂奔」等核心问题,并指出数学发现的瓶颈正从解题能力转向价值判定。 📝 详细摘要 文章围绕 Google DeepMind 的 Aletheia 系统展开,该系统旨在解决数学家保罗·埃尔德什留下的 700 个悬赏难题,并在 7 天内攻克了其中 13 个。文章并未止步于宣传这一成就,而是进行了冷静的批判性分析。它指出 Aletheia 的核心是一个「逻辑洗煤厂」:通过 Gemini 的狂暴算力生成大量候选证明,再经过验证器层层筛选,最

📌 一句话摘要

本文以 DeepMind 的 Aletheia 系统攻克埃尔德什猜想为例,深入剖析了 AI 在数学证明中的能力与局限,揭示了「潜意识剽窃」和「逻辑狂奔」等核心问题,并指出数学发现的瓶颈正从解题能力转向价值判定。

📝 详细摘要

文章围绕 Google DeepMind 的 Aletheia 系统展开,该系统旨在解决数学家保罗·埃尔德什留下的 700 个悬赏难题,并在 7 天内攻克了其中 13 个。文章并未止步于宣传这一成就,而是进行了冷静的批判性分析。它指出 Aletheia 的核心是一个「逻辑洗煤厂」:通过 Gemini 的狂暴算力生成大量候选证明,再经过验证器层层筛选,最终仅得到 2% 的可用成果。文章重点讨论了 AI 在数学领域的两个致命缺陷:一是「潜意识剽窃」,即 AI 可能无意识地复现冷门论文中的思路,缺乏真正的原创性;二是「逻辑狂奔」,即 AI 无法识别题干本身的错误,例如在解决一个被「诅咒」的伪命题时,仍能生成几十页逻辑自洽的证明。文章最后将 DeepMind 的方法与 OpenAI 的「题海战术」进行对比,并引用陶哲轩的观点,指出未来数学家的角色将从「解题者」转变为「审美法官」或「逻辑审计员」,核心能力在于价值判断而非逻辑推导。

💡 主要观点

- DeepMind 的 Aletheia 系统在 700 个埃尔德什猜想中成功证明了 13 个,转化率不足 2%。 Aletheia 的工作流程是:Gemini 大规模生成候选证明,再通过验证器筛选,最终由专家复核。这暴露了当前 AI 在数学领域的高成本、低效率特点,大部分输出是「学术垃圾」。

AI 存在「潜意识剽窃」问题,可能无意识地复现已有成果,缺乏真正的原创性。 Aletheia 对一个猜想的「精妙证明」被发现与 1981 年的冷门论文高度重合。AI 没有原创与抄袭的概念,它只是在概率驱动下重组训练数据中的信息,这引发了学术界对 AI 成果原创性的质疑。
AI 存在「逻辑狂奔」缺陷,无法识别题干本身的错误,会为伪命题生成完美证明。 面对一个题干有逻辑错误的「Erdős-75 号」猜想,Aletheia 仍能输出几十页逻辑闭环的证明。这暴露了 AI 缺乏常识和审美,其奖励函数只关注推导过程的形式正确性,而非命题本身的真伪。

💬 文章金句

- AI 目前的强项不是创造,而是清扫。

  • AI 并不是在做数学,它是在对人类过往的智慧进行大规模的归纳整合。
  • AI 能在几毫秒内跑完几千公里的逻辑马拉松,但它不知道终点线是不是画在悬崖外面。
  • 数学发现的瓶颈,正在从「解题能力」位移到「价值判定」。
  • 逻辑可以代工,但灵魂和审美,AI 暂时还没学会怎么洗。

📊 文章信息

AI 初评:82

来源:新智元

作者:新智元

分类:人工智能

语言:中文

阅读时间:12 分钟

字数:2977

标签: DeepMind, Aletheia, 数学证明, AI 局限, 潜意识剽窃

阅读完整文章

查看原文 → 發佈: 2026-05-04 12:04:00 收錄: 2026-05-04 22:00:09

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。