← 回總覽

图灵奖得主,要用十亿美金赌 AI 的下一个十年(上集)

📅 2026-06-14 12:47 十字路口Crossing 人工智能 2 分鐘 1768 字 評分: 90
AI 前沿 世界模型 Yann LeCun 自监督学习 JEPA
📌 一句话摘要 本文梳理了图灵奖得主 Yann LeCun 对主流大语言模型路线的系统性批判,并详细解释了他押注约 10 亿美元、以 JEPA 和世界模型为核心的非生成式替代方案。 📝 详细摘要 文章基于 Yann LeCun 在科普频道 Welch Labs 的访谈,系统性地阐述了他对当前 AI 发展路线的核心观点。文章从 LeCun 的学术起点——卷积神经网络(CNN)讲起,引出其对监督学习依赖标注数据的担忧,并回顾了其著名的「蛋糕理论」(自监督学习是主体)。随后,文章解释了为什么自监督生成式方法在语言上成功(GPT 系列),却在视频领域遭遇「模糊诅咒」——因为视频的预测空间是连续且无

📌 一句话摘要

本文梳理了图灵奖得主 Yann LeCun 对主流大语言模型路线的系统性批判,并详细解释了他押注约 10 亿美元、以 JEPA 和世界模型为核心的非生成式替代方案。

📝 详细摘要

文章基于 Yann LeCun 在科普频道 Welch Labs 的访谈,系统性地阐述了他对当前 AI 发展路线的核心观点。文章从 LeCun 的学术起点——卷积神经网络(CNN)讲起,引出其对监督学习依赖标注数据的担忧,并回顾了其著名的「蛋糕理论」(自监督学习是主体)。随后,文章解释了为什么自监督生成式方法在语言上成功(GPT 系列),却在视频领域遭遇「模糊诅咒」——因为视频的预测空间是连续且无限的,模型被迫输出平均值。LeCun 由此提出关键问题:模型是否必须是生成式的?他介绍了非生成式的「联合嵌入」方法(如孪生网络),并详细解释了其面临的「表征坍缩」问题,以及通过 Barlow Twins(去冗余)、VICReg 和 DINO 系列等方法如何逐步解决该问题,最终在图像分类上追平监督学习。文章的核心是引出 LeCun 的终极方案:世界模型,其具体实现是 JEPA(联合嵌入预测架构)。JEPA 的核心思想是在抽象的嵌入空间中进行预测,而非在像素层面,从而绕开「模糊诅咒」。文章最后指出,LeCun 认为真正的智能体必须能预判自身行为的后果,而 LLM 的自回归预测无法做到这一点,因此他押注世界模型作为通往自主机器智能的路径。

💡 主要观点

- LeCun 认为大语言模型(LLM)的生成式路线无法通向真正的智能。 核心论据是「模糊诅咒」:在视频等连续、高维空间中,生成式模型无法处理无限的可能性,只能预测模糊的平均值,无法学到对世界的真正理解。

非生成式的「联合嵌入」方法是更优的自监督学习路径。 通过让模型对同一场景的不同视图(如原始图和损坏图)生成相似的嵌入向量,而非生成像素,可以避免「模糊诅咒」,并学到更鲁棒的表征。
「表征坍缩」是联合嵌入方法的主要挑战,Barlow Twins 等方案提供了有效解法。 模型可能偷懒对所有输入输出相同向量。Barlow Twins 通过让不同神经元输出去相关(互相关矩阵逼近单位矩阵),强制模型学习有区分度的特征,从而避免坍缩。
LeCun 的终极方案是「世界模型」,其核心架构是 JEPA(联合嵌入预测架构)。 JEPA 在抽象的嵌入空间中进行预测,而非像素层面。它结合了联合嵌入架构和预测器,能以动作或控制信号为条件,预测世界下一状态的表征,从而用于规划和控制。
LeCun 押注约 10 亿美元,认为真正的智能体必须能预判自身行为的后果。 他认为 LLM 的自回归推理无法胜任这一任务,而基于世界模型的「搜索」式推理才是通往可靠、安全的自主机器智能的关键。

💬 文章金句

- 我们正在 all-in 的大语言模型,根本通不到真正的智能。

  • 如果智能是一块蛋糕,那么蛋糕的主体是自监督学习,糖霜是监督学习,顶上那颗小樱桃才是强化学习。
  • 我无法理解,你怎么能在一个不能预测自身行为后果的系统之上,去构建一个智能体。
  • 真正可靠的智能体,必须能预判一连串动作的结果,再去规划路径、守住安全边界。

📊 文章信息

AI 初评:90

来源:十字路口Crossing

作者:十字路口Crossing

分类:人工智能

语言:中文

阅读时间:31 分钟

字数:7506

标签: AI 前沿, 世界模型, Yann LeCun, 自监督学习, JEPA

阅读完整文章

查看原文 → 發佈: 2026-06-14 12:47:00 收錄: 2026-06-14 22:00:53

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。