Riemann-1.0 通过大规模人类第一视角视频预训练加少量机器人数据微调,在家具家务基准 RoboCasa-365 上达到 62.6% SOTA,展示了人类视频为具身智能带来的泛化提升。
📝 详细摘要
文章介绍了昆仑万维子公司黎曼动力推出的具身智能模型 Riemann-1.0,该模型在 RoboCasa-365 基准上创下 62.6% 的新纪录,比之前最高成绩高出 8.4 个百分点。其核心思想是利用 23.2 万小时的人类第一视角视频(做饭、叠衣服、收拾桌子等)进行大规模预训练,让模型学习物理世界的直觉,随后用少量真实机器人数据进行动作对齐微调。文章详细说明了数据准备流程(“广菜”“精菜”“准菜”),模型架构(基于扩散的全因果动作-视频联合建模及本体专属动作映射模块),以及三阶段训练策略(动作损失权重从 0.1 提升到 0.9)。消融实验表明,人类视频预训练带来的提升远超过单纯数据量增加,尤其在长序列和陌生场景中的泛化提升显著。真机评测中,经过场景特定后训练,Riemann-1.0 在四类家务任务平均成功率达到 85.0%,过程完成度 94.43%,均领先开源基模约 15 个百分点。文章还追溯了昆仑万维从内容 AI 到具身智能的战略布局,指出公司通过成立独立子公司进行长期投入,旨在把世界模型与实体机器人结合,推动 AGI 从屏幕走向物理世界。
💡 主要观点
- Riemann-1.0 通过大规模人类第一视角视频预训练+少量机器人数据微调,在家务基准 RoboCasa-365 上达到 62.6% SOTA。 该模型在 RoboCasa-365 上实现 62.6% 成功率,比之前最高成绩高出 8.4 个百分点,表明人类视频提供了丰富的物理直觉和任务先验,显著提升泛化能力。
💬 文章金句
- 新纪录62.6% ,比之前的 SOTA 直接高出8.4个百分点。
- 为什么是「人的视频」?这还要从具身智能领域吵了一年多的路线之争说起。
- 于是,两条路线开始合流。
- 先用大规模开放世界视频做预训练,让模型看遍人类怎么和物理世界打交道,攒够物理直觉;再用少量真实机器人数据做动作对齐,把直觉翻译成可执行的控制信号。
- 它是国内较早把这条范式完整工程化跑通的选手,从仿真 Benchmark 到真机均获得验证的那种。
📊 文章信息
AI 初评:84
来源:量子位
作者:一水
分类:人工智能
语言:中文
阅读时间:20 分钟
字数:4810
标签: 具身智能, 世界模型, 机器学习, 机器人, 人机交互