文章介绍小米发布的第二代机器人大脑 Xiaomi‑Robotics‑1,通过 10 万小时真实世界操作数据验证机器人领域的 Scaling Law,并展示其开箱即用的能力。
📝 详细摘要
文章回顾了小米从铁蛋到铁大的人形机器人硬件迭代,重点介绍了今年 2 月发布的首代 VLA 模型 Robotics‑0(4.7B 参数,采用 VLM+DiT 双分支架构并加入 Λ 型注意力掩码),以及其在仿真基准上的 SOTA 表现。随后详细说明小米如何利用便携式 UMI(Universal Manipulation Interface)设备在真实场景中采集操作数据,借助 VLM 自动标注将预训练数据从 1 万小时提升至 10 万小时,并在不同数据规模和模型规模(2B/5B/10B)上验证了数据越多、模型越大导致动作预测损失持续下降、训练更稳定的 Scaling Law。文章进一步展示了在未见环境中的实际任务(如鞋柜收纳、书包打包、桌面整理)中的表现,验证了 scaling 法则不仅体现在指标上,还真正转化为机器人在家庭场景中的可用能力,并提出了“开箱即用”和少样本适配的优势。整体表明小米已经在机器人智能体的数据飞轮上迈出关键一步,离家庭机器人管家更近一步。
💡 主要观点
- 小米通过 UMI 设备实现了 10 万小时真实世界操作数据的大规模采集。 UMI 是一种不绑定不到特定硬件的便携式操作采集器,配合 VLM 自动标注,使得数据采集不再受特定机器人平台限制,为后续模型训练提供了丰富且可扩展的真实轨迹。
💬 文章金句
- 机器人的 Scaling Law,被验证了。
- 数据越多,动作预测损失越低,而且较小数据规模下容易过拟合,大数据下训练更稳定。
- 开箱即用这四个字,用在模型能力上是技术术语,用在消费者上就是一个交付承诺。
📊 文章信息
AI 初评:89
来源:卡尔的AI沃茨
作者:卡尔的AI沃茨
分类:人工智能
语言:中文
阅读时间:16 分钟
字数:3774
标签: 具身智能, Scaling Law, VLA 模型, DiT 架构, UMI 数据采集