← 回總覽

全球首个!「具身原生」世界动作模型来了

📅 2026-07-10 13:37 新智元 人工智能 2 分鐘 1316 字 評分: 84
具身智能 世界模型 机器人 AI Agent 模型训练与推理
📌 一句话摘要 蚂蚁灵波发布全球首个具身原生预训练模型 LingBot-VA 2.0,采用因果建模与异步推理,在仿真基准上成功率 93.6%,推动机器人大脑走向自主决策。 📝 详细摘要 文章报道蚂蚁灵波发布的 LingBot-VA 2.0 模型,这是行业首个具身原生预训练模型。文章解释其与主流视频预测路线的区别:采用因果建模,让机器人理解动作与物理世界的因果关系。模型通过语义视觉-动作分词器统一视觉与动作表示,可从无标注互联网视频中学习物理直觉。采用 MoE 稀疏架构和异步 Foresight 推理,单 chunk 推理仅 142 毫秒,控制频率 225Hz。在 RoboTwin 2.0

📌 一句话摘要

蚂蚁灵波发布全球首个具身原生预训练模型 LingBot-VA 2.0,采用因果建模与异步推理,在仿真基准上成功率 93.6%,推动机器人大脑走向自主决策。

📝 详细摘要

文章报道蚂蚁灵波发布的 LingBot-VA 2.0 模型,这是行业首个具身原生预训练模型。文章解释其与主流视频预测路线的区别:采用因果建模,让机器人理解动作与物理世界的因果关系。模型通过语义视觉-动作分词器统一视觉与动作表示,可从无标注互联网视频中学习物理直觉。采用 MoE 稀疏架构和异步 Foresight 推理,单 chunk 推理仅 142 毫秒,控制频率 225Hz。在 RoboTwin 2.0 基准上平均成功率 93.6%,优于同类模型,且对干扰鲁棒。文章还介绍了 VA 与 VLA 的互补关系以及商业应用进展。

💡 主要观点

- 蚂蚁灵波发布 LingBot-VA 2.0,是全球首个具身原生预训练模型。 该模型从数据、训练目标到架构都为机器人在物理世界交互而设计,采用因果建模而非下一帧预测,使机器人理解动作与物理世界的因果关系。

通过语义视觉-动作分词器统一视觉与动作表示,降低对真机数据的依赖。 这种同声传译机制将画面和动作编码为共同语义空间,使模型可从无标注互联网视频中学习物理直觉。
采用 MoE 稀疏架构与异步 Foresight 推理,单卡运行且推理效率高。 按需激活专家模块,单 chunk 推理从 927ms 降至 142ms,控制频率达 225Hz,适应高速动态场景。
在 RoboTwin 2.0 基准上平均成功率 93.6%,优于π0.5 的 79.8%,且对干扰鲁棒。 干净环境与随机化环境表现差距仅 0.4 个百分点,证明模型泛化能力强。
VA 与 VLA 是互补关系,蚂蚁灵波通过投产一代、预研一代的策略,让 VLA 落地数据反哺 VA 迭代。 VLA 已适配 17 家厂商 20 种机器人构型,在物流、零售等场景试点,VA 预研下一代大脑。

💬 文章金句

- 机器人要回答的是一个更硬的问题:如果我这样做,世界会怎样?

  • 想完才动,和边想边动,是两个物种。

📊 文章信息

AI 初评:84

来源:新智元

作者:新智元

分类:人工智能

语言:中文

阅读时间:14 分钟

字数:3441

标签: 具身智能, 世界模型, 机器人, AI Agent, 模型训练与推理

阅读完整文章

查看原文 → 發佈: 2026-07-10 13:37:00 收錄: 2026-07-10 20:00:23

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。