蚂蚁灵波开源 LingBot-Video,全球首个面向具身智能的 MoE 视频基模,在 RBench 基准上得分 0.620,显著提升物理合理性与推理效率。
📝 详细摘要
蚂蚁灵波于 2026 年 7 月 9 日开源 LingBot-Video,这是全球首个基于 Mixture-of-Experts(MoE)架构、面向具身智能的视频生成基础模型。文章从架构、数据和训练三方面详细介绍了其创新点:采用 DiT+MoE 设计,30B 参数仅激活约 3B,推理效率提升约三倍;构建数据画像引擎,加入 7 万小时机器人相关数据(VLA、VLN、Ego 等),覆盖灵巧操作、移动和第一视角交互场景;引入多维强化学习奖励系统,额外对齐物理合理性和任务完成度。在北京大学联合字节跳动的 RBench 基准上,LingBot-Video 得分 0.620,超越 Wan2.6、Seedance1.5 Pro、Cosmos3 Super 等主流开源模型,表明其生成视频更符合真实物理规律,能更好支持机器人任务规划与执行。模型已开源,可用于机器人动作预测、仿真数据生成、动作条件建模、世界模型研究等方向。
💡 主要观点
- LingBot-Video 是全球首个面向具身智能的开源视频基础模型,基于 Mixture-of-Experts 架构。 该模型在保持大规模参数表达能力的同时,通过稀疏激活显著提升推理效率,适用于机器人实时交互场景。
💬 文章金句
- LingBot-Video 的总分是 0.620,超越了 Wan2.6(0.607)、Seedance1.5 Pro(0.584)、Cosmos3 Super(0.581)。
- 其 30B 总参数模型在生成时仅激活约 3B 参数,相比同等参数规模 Dense 架构拥有约 3 倍推理效率。
- 据介绍,LingBot-Video 可用于机器人动作预测、仿真数据生成、动作条件建模、世界模型研究等方向。
📊 文章信息
AI 初评:80
来源:量子位
作者:量子位的朋友们
分类:人工智能
语言:中文
阅读时间:6 分钟
字数:1352
标签: 具身智能, 视频生成, MoE 架构, 开源模型, 机器人数据