← 回總覽

小米 10 万小时喂出来的机器人大脑,我来验收一把

📅 2026-07-16 17:02 卡尔的AI沃茨 人工智能 2 分鐘 1607 字 評分: 89
具身智能 Scaling Law VLA 模型 DiT 架构 UMI 数据采集
📌 一句话摘要 文章介绍小米发布的第二代机器人大脑 Xiaomi‑Robotics‑1,通过 10 万小时真实世界操作数据验证机器人领域的 Scaling Law,并展示其开箱即用的能力。 📝 详细摘要 文章回顾了小米从铁蛋到铁大的人形机器人硬件迭代,重点介绍了今年 2 月发布的首代 VLA 模型 Robotics‑0(4.7B 参数,采用 VLM+DiT 双分支架构并加入 Λ 型注意力掩码),以及其在仿真基准上的 SOTA 表现。随后详细说明小米如何利用便携式 UMI(Universal Manipulation Interface)设备在真实场景中采集操作数据,借助 VLM 自动标注将

📌 一句话摘要

文章介绍小米发布的第二代机器人大脑 Xiaomi‑Robotics‑1,通过 10 万小时真实世界操作数据验证机器人领域的 Scaling Law,并展示其开箱即用的能力。

📝 详细摘要

文章回顾了小米从铁蛋到铁大的人形机器人硬件迭代,重点介绍了今年 2 月发布的首代 VLA 模型 Robotics‑0(4.7B 参数,采用 VLM+DiT 双分支架构并加入 Λ 型注意力掩码),以及其在仿真基准上的 SOTA 表现。随后详细说明小米如何利用便携式 UMI(Universal Manipulation Interface)设备在真实场景中采集操作数据,借助 VLM 自动标注将预训练数据从 1 万小时提升至 10 万小时,并在不同数据规模和模型规模(2B/5B/10B)上验证了数据越多、模型越大导致动作预测损失持续下降、训练更稳定的 Scaling Law。文章进一步展示了在未见环境中的实际任务(如鞋柜收纳、书包打包、桌面整理)中的表现,验证了 scaling 法则不仅体现在指标上,还真正转化为机器人在家庭场景中的可用能力,并提出了“开箱即用”和少样本适配的优势。整体表明小米已经在机器人智能体的数据飞轮上迈出关键一步,离家庭机器人管家更近一步。

💡 主要观点

- 小米通过 UMI 设备实现了 10 万小时真实世界操作数据的大规模采集。 UMI 是一种不绑定不到特定硬件的便携式操作采集器,配合 VLM 自动标注,使得数据采集不再受特定机器人平台限制,为后续模型训练提供了丰富且可扩展的真实轨迹。

实验验证了机器人领域的 Scaling Law:数据量和模型规模越大,动作预测损失越低且训练更稳定。 分别使用 2.5K、5K、10K、20K 小时的 UMI 数据以及 2B、5B、10B 三种模型规模进行对比,结果呈线性改善趋势,未见明显性能天花板,表明机器人也遵循数据‑模型‑算力的 scaling 原则。
在未见环境中的实际任务测试中,模型表现出强大的泛化和执行能力。 机器人在从未见过的房间里完成鞋柜收纳、书包打包、桌面整理等任务,能够识别物品大小、软硬属性、决定放置顺序并控制力度,说明 scaling 法则所提升的表示能力真正转化为可用的运动技能。
提出“开箱即用”和少样本适配的使用理念,降低了消费者使用门槛。 得益于大规模预训练的通用基座模型,用户只需将机器人放入新环境并通过语音指令即可完成任务,无需为每个家庭重新采集大量数据或进行专门微调;面对全新任务时,仅需少量真机数据即可快速适配。

💬 文章金句

- 机器人的 Scaling Law,被验证了。

  • 数据越多,动作预测损失越低,而且较小数据规模下容易过拟合,大数据下训练更稳定。
  • 开箱即用这四个字,用在模型能力上是技术术语,用在消费者上就是一个交付承诺。

📊 文章信息

AI 初评:89

来源:卡尔的AI沃茨

作者:卡尔的AI沃茨

分类:人工智能

语言:中文

阅读时间:16 分钟

字数:3774

标签: 具身智能, Scaling Law, VLA 模型, DiT 架构, UMI 数据采集

阅读完整文章

查看原文 → 發佈: 2026-07-16 17:02:00 收錄: 2026-07-16 22:00:53

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。