本文以 DeepMind 的 Aletheia 系统攻克埃尔德什猜想为例,深入剖析了 AI 在数学证明中的能力与局限,揭示了「潜意识剽窃」和「逻辑狂奔」等核心问题,并指出数学发现的瓶颈正从解题能力转向价值判定。
📝 详细摘要
文章围绕 Google DeepMind 的 Aletheia 系统展开,该系统旨在解决数学家保罗·埃尔德什留下的 700 个悬赏难题,并在 7 天内攻克了其中 13 个。文章并未止步于宣传这一成就,而是进行了冷静的批判性分析。它指出 Aletheia 的核心是一个「逻辑洗煤厂」:通过 Gemini 的狂暴算力生成大量候选证明,再经过验证器层层筛选,最终仅得到 2% 的可用成果。文章重点讨论了 AI 在数学领域的两个致命缺陷:一是「潜意识剽窃」,即 AI 可能无意识地复现冷门论文中的思路,缺乏真正的原创性;二是「逻辑狂奔」,即 AI 无法识别题干本身的错误,例如在解决一个被「诅咒」的伪命题时,仍能生成几十页逻辑自洽的证明。文章最后将 DeepMind 的方法与 OpenAI 的「题海战术」进行对比,并引用陶哲轩的观点,指出未来数学家的角色将从「解题者」转变为「审美法官」或「逻辑审计员」,核心能力在于价值判断而非逻辑推导。
💡 主要观点
- DeepMind 的 Aletheia 系统在 700 个埃尔德什猜想中成功证明了 13 个,转化率不足 2%。 Aletheia 的工作流程是:Gemini 大规模生成候选证明,再通过验证器筛选,最终由专家复核。这暴露了当前 AI 在数学领域的高成本、低效率特点,大部分输出是「学术垃圾」。
💬 文章金句
- AI 目前的强项不是创造,而是清扫。
- AI 并不是在做数学,它是在对人类过往的智慧进行大规模的归纳整合。
- AI 能在几毫秒内跑完几千公里的逻辑马拉松,但它不知道终点线是不是画在悬崖外面。
- 数学发现的瓶颈,正在从「解题能力」位移到「价值判定」。
- 逻辑可以代工,但灵魂和审美,AI 暂时还没学会怎么洗。
📊 文章信息
AI 初评:82
来源:新智元
作者:新智元
分类:人工智能
语言:中文
阅读时间:12 分钟
字数:2977
标签: DeepMind, Aletheia, 数学证明, AI 局限, 潜意识剽窃