← 回總覽

蚂蚁灵波开源 LingBot-Video,全球首个面向具身的视频基模来了!

📅 2026-07-09 11:19 量子位的朋友们 人工智能 2 分鐘 1695 字 評分: 80
具身智能 视频生成 MoE 架构 开源模型 机器人数据
📌 一句话摘要 蚂蚁灵波开源 LingBot-Video,全球首个面向具身智能的 MoE 视频基模,在 RBench 基准上得分 0.620,显著提升物理合理性与推理效率。 📝 详细摘要 蚂蚁灵波于 2026 年 7 月 9 日开源 LingBot-Video,这是全球首个基于 Mixture-of-Experts(MoE)架构、面向具身智能的视频生成基础模型。文章从架构、数据和训练三方面详细介绍了其创新点:采用 DiT+MoE 设计,30B 参数仅激活约 3B,推理效率提升约三倍;构建数据画像引擎,加入 7 万小时机器人相关数据(VLA、VLN、Ego 等),覆盖灵巧操作、移动和第一视角

📌 一句话摘要

蚂蚁灵波开源 LingBot-Video,全球首个面向具身智能的 MoE 视频基模,在 RBench 基准上得分 0.620,显著提升物理合理性与推理效率。

📝 详细摘要

蚂蚁灵波于 2026 年 7 月 9 日开源 LingBot-Video,这是全球首个基于 Mixture-of-Experts(MoE)架构、面向具身智能的视频生成基础模型。文章从架构、数据和训练三方面详细介绍了其创新点:采用 DiT+MoE 设计,30B 参数仅激活约 3B,推理效率提升约三倍;构建数据画像引擎,加入 7 万小时机器人相关数据(VLA、VLN、Ego 等),覆盖灵巧操作、移动和第一视角交互场景;引入多维强化学习奖励系统,额外对齐物理合理性和任务完成度。在北京大学联合字节跳动的 RBench 基准上,LingBot-Video 得分 0.620,超越 Wan2.6、Seedance1.5 Pro、Cosmos3 Super 等主流开源模型,表明其生成视频更符合真实物理规律,能更好支持机器人任务规划与执行。模型已开源,可用于机器人动作预测、仿真数据生成、动作条件建模、世界模型研究等方向。

💡 主要观点

- LingBot-Video 是全球首个面向具身智能的开源视频基础模型,基于 Mixture-of-Experts 架构。 该模型在保持大规模参数表达能力的同时,通过稀疏激活显著提升推理效率,适用于机器人实时交互场景。

在面向机器人操作视频的 RBench 基准上,LingBot-Video 得分 0.620,超越 Wan2.6、Seedance1.5 Pro、Cosmos3 Super 等主流开源模型。 该成绩表明其生成的视频更符合真实物理规律,能更好支持机器人任务规划与执行。
架构创新采用 DiT+MoE 设计,30B 总参数仅激活约 3B,推理效率约是同等密集架构的三倍。 稀疏激活降低计算成本,使模型在保持强大视觉表达的同时满足具身智能对低延迟的需求。
数据方面构建了数据画像引擎,在海量互联网视频基础上加入 7 万小时机器人相关数据(VLA、VLN、Ego 等),覆盖灵巧操作、移动和第一视角交互场景。 这些具身数据帮助模型学习动作与环境变化的因果关系,而不仅仅是视觉纹理。
训练引入多维强化学习奖励系统,除了美学、prompt 跟随和运动一致性外,还加入物理合理性和任务完成度对齐,使生成结果更贴近真实世界机器人行为。 这种奖励设计引导模型生成既美观又符合物理律的视频,提升下游任务的可用性。

💬 文章金句

- LingBot-Video 的总分是 0.620,超越了 Wan2.6(0.607)、Seedance1.5 Pro(0.584)、Cosmos3 Super(0.581)。

  • 其 30B 总参数模型在生成时仅激活约 3B 参数,相比同等参数规模 Dense 架构拥有约 3 倍推理效率。
  • 据介绍,LingBot-Video 可用于机器人动作预测、仿真数据生成、动作条件建模、世界模型研究等方向。

📊 文章信息

AI 初评:80

来源:量子位

作者:量子位的朋友们

分类:人工智能

语言:中文

阅读时间:6 分钟

字数:1352

标签: 具身智能, 视频生成, MoE 架构, 开源模型, 机器人数据

阅读完整文章

查看原文 → 發佈: 2026-07-09 11:19:15 收錄: 2026-07-09 20:00:29

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。