生数科技通过通用世界模型,将视频生成、实时交互与机器人行动统一,实现从数字内容生成到物理世界理解、推演与行动的闭环。
📝 详细摘要
文章介绍了生数科技的通用世界模型战略。作者指出,世界模型不仅是视频或语言模型的升级,而是 AI 从“生成内容”迈向“理解世界、推演世界、与世界实时交互”的新范式。模型需具备理解当前环境、预测不同输入或动作导致的变化,并将理解与预测转化为可执行决策的三步闭环。在数据层面,生数科技构建了从互联网视频到机器人实采轨迹的“数据金字塔”,利用海量视频学习通用世界规律,再用机器人数据补充精确动作知识和物理反馈。在架构上,采用 Mixture-of-Transformer(MoT)将环境理解、世界状态预测和动作轨迹生成统一框架,使得同一底座既能在像素空间生成视频(Vidu、Vidu S1),也能在动作空间输出机器人可执行动作(Motubrain)。文章进一步阐述了数字世界与物理世界的互补:数字世界提供规模大、试错成本低的数据和快速产品反馈;物理世界则提供精确动作数据和严格的因果检验,二者可形成正向循环。最后强调,该技术仍需接受生产力的检验——在数字世界看内容可用率和生产成本;在物理世界看机器人能否在真实任务中长期稳定运行。
💡 主要观点
- 世界模型的核心是理解、想象(预测)与行动的闭环。 模型需先感知环境,再预测不同输入或动作导致的状态变化,最后将理解与预测转化为可执行决策,这与人类学习骑车、开车时的预判过程类似。
💬 文章金句
- 世界模型是 AI 从生成内容,迈向理解世界、推演世界、与世界实时交互的新范式。
- 基于同一底层基座,模型既可以在像素空间生成视频内容,也可以在动作空间输出机器人可执行的动作。
- 视频数据不能替代机器人数据。视频可以告诉模型动作在视觉上如何发生、环境如何变化,却无法完整提供机器人执行所需的关节角度、力反馈、本体状态和控制信号。
- 数字世界帮助模型扩大对世界的认知范围,并提供更快的产品反馈;物理世界则检验这些认知能否转化为准确、稳定的行动。
📊 文章信息
AI 初评:80
来源:雷峰网
作者:雷峰网
分类:人工智能
语言:中文
阅读时间:20 分钟
字数:4780
标签: 世界模型, 视频生成, 具身智能, 机器人控制, 实时交互