← 回總覽

从生成到行动,生数科技用通用世界模型连接「两个世界」

📅 2026-07-22 08:48 雷峰网 人工智能 2 分鐘 1739 字 評分: 80
世界模型 视频生成 具身智能 机器人控制 实时交互
📌 一句话摘要 生数科技通过通用世界模型,将视频生成、实时交互与机器人行动统一,实现从数字内容生成到物理世界理解、推演与行动的闭环。 📝 详细摘要 文章介绍了生数科技的通用世界模型战略。作者指出,世界模型不仅是视频或语言模型的升级,而是 AI 从“生成内容”迈向“理解世界、推演世界、与世界实时交互”的新范式。模型需具备理解当前环境、预测不同输入或动作导致的变化,并将理解与预测转化为可执行决策的三步闭环。在数据层面,生数科技构建了从互联网视频到机器人实采轨迹的“数据金字塔”,利用海量视频学习通用世界规律,再用机器人数据补充精确动作知识和物理反馈。在架构上,采用 Mixture-of-Tran

📌 一句话摘要

生数科技通过通用世界模型,将视频生成、实时交互与机器人行动统一,实现从数字内容生成到物理世界理解、推演与行动的闭环。

📝 详细摘要

文章介绍了生数科技的通用世界模型战略。作者指出,世界模型不仅是视频或语言模型的升级,而是 AI 从“生成内容”迈向“理解世界、推演世界、与世界实时交互”的新范式。模型需具备理解当前环境、预测不同输入或动作导致的变化,并将理解与预测转化为可执行决策的三步闭环。在数据层面,生数科技构建了从互联网视频到机器人实采轨迹的“数据金字塔”,利用海量视频学习通用世界规律,再用机器人数据补充精确动作知识和物理反馈。在架构上,采用 Mixture-of-Transformer(MoT)将环境理解、世界状态预测和动作轨迹生成统一框架,使得同一底座既能在像素空间生成视频(Vidu、Vidu S1),也能在动作空间输出机器人可执行动作(Motubrain)。文章进一步阐述了数字世界与物理世界的互补:数字世界提供规模大、试错成本低的数据和快速产品反馈;物理世界则提供精确动作数据和严格的因果检验,二者可形成正向循环。最后强调,该技术仍需接受生产力的检验——在数字世界看内容可用率和生产成本;在物理世界看机器人能否在真实任务中长期稳定运行。

💡 主要观点

- 世界模型的核心是理解、想象(预测)与行动的闭环。 模型需先感知环境,再预测不同输入或动作导致的状态变化,最后将理解与预测转化为可执行决策,这与人类学习骑车、开车时的预判过程类似。

视频数据是通用世界模型的重要底座,但不能替代机器人数据。 海量互联网视频提供时空规律和动态预测的基础,却缺少关节角度、力反馈等物理细节;机器人轨迹数据则补足精确动作知识,二者结合可提升认知广度与行动精度。
MoT 架构统一感知、预测与动作,使 Vidu、Vidu S1、Motubrain 成为同一体系的渐进延伸。 通过将环境理解、世界状态预测和动作轨迹生成整合到统一框架,模型既能在像素空间生成视频,也能在动作空间输出机器人动作,实现从数字内容生成到物理行动的无缝过渡。
数字世界与物理世界在数据、反馈与能力验证上形成互补。 数字世界提供规模大、使用频率高、试错成本低的数据和快速产品反馈;物理世界则提供精确动作数据和严格的因果检验,二者可相互促进,使模型认知更全面、行动更可靠。
技术最终需接受生产力的检验:内容可用率与机器人稳定运行。 在数字世界要看模型能否提高内容可用率、减少返工并降低生产成本;在物理世界要看机器人能否走出仿真、在不同本体、任务和动态环境中长期稳定运行,这才是通用世界模型的真正价值。

💬 文章金句

- 世界模型是 AI 从生成内容,迈向理解世界、推演世界、与世界实时交互的新范式。

  • 基于同一底层基座,模型既可以在像素空间生成视频内容,也可以在动作空间输出机器人可执行的动作。
  • 视频数据不能替代机器人数据。视频可以告诉模型动作在视觉上如何发生、环境如何变化,却无法完整提供机器人执行所需的关节角度、力反馈、本体状态和控制信号。
  • 数字世界帮助模型扩大对世界的认知范围,并提供更快的产品反馈;物理世界则检验这些认知能否转化为准确、稳定的行动。

📊 文章信息

AI 初评:80

来源:雷峰网

作者:雷峰网

分类:人工智能

语言:中文

阅读时间:20 分钟

字数:4780

标签: 世界模型, 视频生成, 具身智能, 机器人控制, 实时交互

阅读完整文章

查看原文 → 發佈: 2026-07-22 08:48:00 收錄: 2026-07-22 16:00:45

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。