智源研究院院长王仲远在专访中系统阐述了世界模型的技术路线、与具身智能的关系,并判断世界模型处于深度学习 2012 年阶段,VLA 是当下,世界模型是未来。
📝 详细摘要
本文是 36 氪旗下硬氪对智源研究院院长王仲远的专访。王仲远系统梳理了当前世界模型的四条主流技术路线(语言中心、像素中心、三维结构中心、视觉表征中心),并介绍了智源研究院尝试的第五条路线——在统一潜空间中融合语言与视觉表征。他明确区分了视频生成模型与真正的世界模型,指出后者必须满足物理正确、动作因果可溯、长时序一致性和通用泛化能力四个条件。在具身智能方面,他认为 VLA 是当下可用的技术,但世界模型才是解决泛化、长程任务和复杂推理的未来方向。他判断世界模型和具身智能大致处于深度学习 2012 年的阶段,数据缺乏、技术路线未收敛,但中美在同一起跑线。文章还讨论了数据瓶颈、仿真数据的局限、短期落地场景(沿途下蛋)以及算力基础设施的可复用性。
💡 主要观点
- 世界模型不等于视频生成模型,需具备物理正确、因果推理、长时序一致性和泛化能力。 王仲远明确反对将 Sora 等视频生成模型等同于世界模型,认为真正的世界模型必须理解物理规律、动作与结果的因果关系,并能处理连续状态变化,而非仅生成逼真画面。
💬 文章金句
- 视频生成不等于世界模型。
- VLA 是当下,世界模型是未来。
- 世界模型和具身智能大概处在 2012 年的时期。
- 世界模型没有差距,大家站在同一起跑线。
📊 文章信息
AI 初评:86
来源:36氪
作者:36氪
分类:人工智能
语言:中文
阅读时间:28 分钟
字数:6834
标签: 世界模型, 具身智能, VLA, AI 商业化, AI 前沿