← 回總覽

智源研究院院长王仲远:VLA 不会死,但世界模型是未来丨 36 氪专访

📅 2026-06-15 21:30 36氪 人工智能 2 分鐘 1445 字 評分: 86
世界模型 具身智能 VLA AI 商业化 AI 前沿
📌 一句话摘要 智源研究院院长王仲远在专访中系统阐述了世界模型的技术路线、与具身智能的关系,并判断世界模型处于深度学习 2012 年阶段,VLA 是当下,世界模型是未来。 📝 详细摘要 本文是 36 氪旗下硬氪对智源研究院院长王仲远的专访。王仲远系统梳理了当前世界模型的四条主流技术路线(语言中心、像素中心、三维结构中心、视觉表征中心),并介绍了智源研究院尝试的第五条路线——在统一潜空间中融合语言与视觉表征。他明确区分了视频生成模型与真正的世界模型,指出后者必须满足物理正确、动作因果可溯、长时序一致性和通用泛化能力四个条件。在具身智能方面,他认为 VLA 是当下可用的技术,但世界模型才是解决

📌 一句话摘要

智源研究院院长王仲远在专访中系统阐述了世界模型的技术路线、与具身智能的关系,并判断世界模型处于深度学习 2012 年阶段,VLA 是当下,世界模型是未来。

📝 详细摘要

本文是 36 氪旗下硬氪对智源研究院院长王仲远的专访。王仲远系统梳理了当前世界模型的四条主流技术路线(语言中心、像素中心、三维结构中心、视觉表征中心),并介绍了智源研究院尝试的第五条路线——在统一潜空间中融合语言与视觉表征。他明确区分了视频生成模型与真正的世界模型,指出后者必须满足物理正确、动作因果可溯、长时序一致性和通用泛化能力四个条件。在具身智能方面,他认为 VLA 是当下可用的技术,但世界模型才是解决泛化、长程任务和复杂推理的未来方向。他判断世界模型和具身智能大致处于深度学习 2012 年的阶段,数据缺乏、技术路线未收敛,但中美在同一起跑线。文章还讨论了数据瓶颈、仿真数据的局限、短期落地场景(沿途下蛋)以及算力基础设施的可复用性。

💡 主要观点

- 世界模型不等于视频生成模型,需具备物理正确、因果推理、长时序一致性和泛化能力。 王仲远明确反对将 Sora 等视频生成模型等同于世界模型,认为真正的世界模型必须理解物理规律、动作与结果的因果关系,并能处理连续状态变化,而非仅生成逼真画面。

VLA 是当下,世界模型是未来。 VLA 在特定场景(如工厂分拣)有效,但泛化性不足、难以处理长程复杂任务。世界模型旨在解决更底层的物理世界理解问题,是具身智能走向通用化的关键。
世界模型和具身智能处于深度学习 2012 年阶段,中美在同一起跑线。 当前数据缺乏、技术路线未收敛,类比深度学习从 2012 年到 ChatGPT 的十年历程。王仲远认为世界模型可能 3-5 年进入爆发期,且中国与海外没有差距。
数据是核心瓶颈,真实物理世界数据散落且不足,仿真数据不能完全依赖。 大语言模型依赖互联网数据,世界模型需要真实交互、动作轨迹等数据。仿真数据可补充,但其精准度存疑,未来需探索多种数据的配比方案。
短期具身智能会沿途下蛋,在 To B 场景落地并积累数据。 在等待世界模型成熟前,具身机器人先在工厂、酒店等具体场景中执行任务,产生真实数据反哺模型训练,形成技术与产品协同演进的闭环。

💬 文章金句

- 视频生成不等于世界模型。

  • VLA 是当下,世界模型是未来。
  • 世界模型和具身智能大概处在 2012 年的时期。
  • 世界模型没有差距,大家站在同一起跑线。

📊 文章信息

AI 初评:86

来源:36氪

作者:36氪

分类:人工智能

语言:中文

阅读时间:28 分钟

字数:6834

标签: 世界模型, 具身智能, VLA, AI 商业化, AI 前沿

阅读完整文章

查看原文 → 發佈: 2026-06-15 21:30:00 收錄: 2026-06-16 10:00:31

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。