📌 一句话摘要 蚂蚁灵波发布全球首个具身原生预训练模型 LingBot-VA 2.0,采用因果建模与异步推理,在仿真基准上成功率 93.6%,推动机器人大脑走向自主决策。 📝 详细摘要 文章报道蚂蚁灵波发布的 LingBot-VA 2.0 模型,这是行业首个具身原生预训练模型。文章解释其与主流视频预测路线的区别:采用因果建模,让机器人理解动作与物理世界的因果关系。模型通过语义视觉-动作分词器统一视觉与动作表示,可从无标注互联网视频中学习物理直觉。采用 MoE 稀疏架构和异步 Foresight 推理,单 chunk 推理仅 142 毫秒,控制频率 225Hz。在 RoboTwin 2.0
📌 一句话摘要
蚂蚁灵波发布全球首个具身原生预训练模型 LingBot-VA 2.0,采用因果建模与异步推理,在仿真基准上成功率 93.6%,推动机器人大脑走向自主决策。
📝 详细摘要
文章报道蚂蚁灵波发布的 LingBot-VA 2.0 模型,这是行业首个具身原生预训练模型。文章解释其与主流视频预测路线的区别:采用因果建模,让机器人理解动作与物理世界的因果关系。模型通过语义视觉-动作分词器统一视觉与动作表示,可从无标注互联网视频中学习物理直觉。采用 MoE 稀疏架构和异步 Foresight 推理,单 chunk 推理仅 142 毫秒,控制频率 225Hz。在 RoboTwin 2.0 基准上平均成功率 93.6%,优于同类模型,且对干扰鲁棒。文章还介绍了 VA 与 VLA 的互补关系以及商业应用进展。
💡 主要观点
-
蚂蚁灵波发布 LingBot-VA 2.0,是全球首个具身原生预训练模型。
该模型从数据、训练目标到架构都为机器人在物理世界交互而设计,采用因果建模而非下一帧预测,使机器人理解动作与物理世界的因果关系。
通过语义视觉-动作分词器统一视觉与动作表示,降低对真机数据的依赖。
这种同声传译机制将画面和动作编码为共同语义空间,使模型可从无标注互联网视频中学习物理直觉。
采用 MoE 稀疏架构与异步 Foresight 推理,单卡运行且推理效率高。
按需激活专家模块,单 chunk 推理从 927ms 降至 142ms,控制频率达 225Hz,适应高速动态场景。
在 RoboTwin 2.0 基准上平均成功率 93.6%,优于π0.5 的 79.8%,且对干扰鲁棒。
干净环境与随机化环境表现差距仅 0.4 个百分点,证明模型泛化能力强。
VA 与 VLA 是互补关系,蚂蚁灵波通过投产一代、预研一代的策略,让 VLA 落地数据反哺 VA 迭代。
VLA 已适配 17 家厂商 20 种机器人构型,在物流、零售等场景试点,VA 预研下一代大脑。
💬 文章金句
- 机器人要回答的是一个更硬的问题:如果我这样做,世界会怎样?
📊 文章信息
AI 初评:84
来源:新智元
作者:新智元
分类:人工智能
语言:中文
阅读时间:14 分钟
字数:3441
标签:
具身智能, 世界模型, 机器人, AI Agent, 模型训练与推理
阅读完整文章