← 回總覽

端到端 vs 上下分层:机器人路径之争,正在转向?

📅 2026-07-16 08:00 硅谷101 商业科技 30 分鐘 37350 字 評分: 87
机器人 Sim-to-Real 3D 数据集 上下分层 强化学习
📌 一句话摘要 苏度科技 CEO 韩铮深度解析机器人操作的「圣杯」难题,详述其为何押注上下分层架构与 Sim-to-Real 技术路径,并预言该路线将重回主流。 📝 详细摘要 本期节目深度访谈机器人初创公司苏度科技 CEO 韩铮,聚焦于实现通用机器人「动手」能力的技术路径之争。韩铮详细阐述了苏度科技「全栈自研」(大脑+本体)的定位,及其「上下分层」的核心技术架构:上层负责任务规划与理解,下层基于自研高精度 3D 数据集和强化学习,在仿真器(Simulator)中经历数百万年「进化」后,再将操作能力迁移至真实机器人。他强调,机器人操作物体的难度比运动控制高 2-3 个数量级,需要亚毫米级精度

Title: E244|End-to-End vs Hierarchical Layering: The Robot Path ...

URL Source: https://www.bestblogs.dev/podcast/303835284?amp%3Butm_medium=feed&%3Butm_campaign=resources&%3Bentry=rss_article_item

Published Time: 2026-07-16 08:00:00

Markdown Content: PODCAST

87

Sudu Technology CEO Han Zheng deeply analyzes the 'holy grail' challenge of robot manipulation, details why his company bets on hierarchical layering architecture and Sim-to-Real technology path, and predicts this route will return to the mainstream. 硅 硅谷101

Today 01:17:19 24 chapters View Source →

!Image 1: E244|End-to-End vs Hierarchical Layering: The Robot Path Debate Is Shifting?

00:00 00:00

00:01 1

Hello, 大家好,欢迎收听硅谷 101,我是红军。之前我反复在播客里有跟机器人的公司讨论一个问题,就是说我们能不能通过一个 demo 就判断一家机器人公司技术上的好坏?很多人告诉我的答案是不能,原因在于大家并不知道在这个 demo 之前,这些机器人公司有没有针对特定的环境去做适配。哪怕我们说只是在展出的前几天,他到现场去采集一下环境数据,可能都会对 demo 有很大的帮注。所以如果对环境做了更多的优化,机器人 demo 的效果就会更好。而今天我们要聊的这家公司叫做速度科技,它就敢在一个完全没有训练的新环境中去做 demo,它的效果到底怎么样?

00:52 1

说到苏度,在机器人的这条路上,其实有一个绕不开的名字,就是它的联合创始人苏皓。教机器人看懂世界的 image net,有它主流的机器人仿真器,大多都和它的团队有渊源。连硅谷最火的那几家机器人公司,比如说像 physical intelligence、谷歌的 deep mind 的机器人团队,也都有他的学生和师弟师妹,可以说他们是这条路上开衫一派。而他自己现在最想啃的,也是机器人最难的那块骨头,就是让机器人动手,让机器人在开放世界动手有多难。他的合伙人韩铮是这么说的。

01:33 2

机器人如果是要对于物体去做操作,它这个难度要高 2 到 3 个数量级。

01:39 1

另外我今年在跟很多机器人领域的人聊天的时候,大家一直认为在现在的机器人的训练方法和实现路径上是没有收敛的那韩铮他并没有站在硅谷主流的那一派路径上。他认为在今年的下半年,所有人都会重新回到他们现在正在走的这条路上。

02:01 2

我们有一个暴论,就是可能从今年的下半年开始,上下分层的这种结构会重新再回到主流里边。而且可能在之后大家选择的方案推到商业化里面去,可能是最终的一个方法。

02:15 1

这期节目我们就来聊透三件事儿,机器人的 3D 数据从哪里来?Seem to real 这条路到底能不能走通,以及这场全球机器人竞赛各大头部玩家他们的技术路径是什么?谁能真正的跑出来?今天跟我在一起的嘉宾是苏度科技的联合创始人与 CEO 韩铮。Hello, 韩总你好。

02:37 2

红军你好。很高兴来到五谷 101 的节目。

02:41 1

我看你们现在做机器人其实也是很火。我看见新闻的消息是说投资人基本上很难抢到你们的投资份额。因为现在其实做机器人的公司也非常的多。我初步把它分成两层,一层是造大脑的机器人,以硅谷的派为代表的。其实这类的公司在硅谷我觉得还蛮多的,包括最近拿融资的估值 140 亿美元的 skilled。还有一块就是说造身体做人形跟做机器臂的机器人公司。这类机器人公司像马斯克的 optimus 语数,包括 figure 它算在哪一边,我们待会儿可以再详细的聊一聊。但是我觉得大家在初步看到一个机器人公司跟看到他的 demo 的时候,其实很难分清楚这个机器人公司到底是做什么的对,所以开始的时候您要不要简单给您的公司做一个定位,看看我们速度在做机器人的那个环节。

03:32 2

好的,我们其实是大脑和本体都做。其实也是现在很多的机器人公司都在强调的一点,就是要全栈,要做整个的系统。但整个的团队的背景其实是在将近十年以前,就是开始往机器人,以机器学习的方法来驱动机器人方向来做探索和尝试的时候,主要都是以软件为主。直到 22 年团队开始以商业化的方式来做准备的时候,我们才开始正式的考虑自己来做硬件的本体。当然也是因为很多年积累下来的经验,就是如果自己不碰本体的话,也很难把大脑的能力展现,甚至说能够去做一些迭代和探索。所以简单来讲的话,我们是做全栈。

04:12 1

如果我们要类比一家硅谷的,大家现在已经比较熟悉名字的这些机器人公司,你觉得你们做的这些环节跟哪一家机器人公司是更接近的,还是说市场上没有对标者?

04:24 2

我觉得硅谷的机器人公司,不管是像 optimus 还是上一代的柏顺动力,还是 figure 5X 的话,其实都是本体加模型。不过这几家公司在模型测的能力相对来说比 physical EELLIINS,包括 skilled 的话要稍微没有那么专注。

04:44 1

所以你们现在核心最专注的方向是什么?是模型的大脑层,还是说操作的层面。比如说我们刚刚提到的 optimus,它是一个大家最经典的人形机器人,它除了要做手部的这种操作,他也要去做运动。我看见你们的那个 demo,那个机器人,它其实是带一个滚轮的机器人,你的核心的控制是集中在手部环节的。我并不是说一定说做人形就比做手不好,因为我们之前的博客其实有讨论过,灵巧手势机器人可能是最后一公里跟最难的一部分。我想简单的还是来做一个定位上的区隔。

05:23 2

对我觉得做机器人的仿技术 model,做基础模型,特别是做操作模型的大部分团队,其实都会类似于像我们以及 physical intelligence 这样的公司,专注在像 grouper arch 加卓尔,他对于物体的操作和能力,先把它拉到一定能力的边界。在有一些比如说像二指的夹爪不太好处理的情况之下,再看能不能用多只手或者是灵巧手来做处理。但人形机械公司为了让大家感觉到像人我觉得这一波的风潮其实是在大概两年左右 optimism 出来的时候。大家对于我给大家描绘的类人形机器人重新回到大家公众的视野,其实是起到了非常强的引导的作用。

06:07 2

但在我们看的话,机器人里边要做的物体操作任务,可能 90%不一定需要零销售。剩下的可能 5%到 10%的任务的话,才真正需要多只手。另外是不是双足和轮式,现在机器人的下肢还不是特别的稳定。一会儿我们可能也会提到像语数机器人和波振动力 figure optimum,现在对于环境的认知和感知其实还不是特别强,以及它经常会出现跌倒的情况。所以我们在现在这个阶段可能还是会把操作的任务和下肢灵巧的程度相对来说会解耦一下。但未来我们感觉可能还是会回归到同。

06:48 1

一条线上来。未来的同一条线你指的是通用机器人。

06:52 2

对通用的机器人的构型,它应该是一个带有族式,或者是我们自己内部认为的话可能是一个轮族式的的构型。它在平地的时候的话,可能会有稳定和高效的一个方式移动。但是在比如说遇到一些特殊的地形的时候,还是会像人或者是其他动物一样,有双足或者是四足之间的某一种形态在移动。

07:14 1

对,因为我觉得我们要看每一家公司做机器人,他的思路有什么不一样。可能要从他的整个的历史说起。我知道你的联合创始人苏浩,他是李飞飞的学生。李飞飞当年成名之战是 image net,他给上百万的图片做人工标注,然后让机器第一次看这个足够多的世界。苏浩他其实就是 image net 的核心作者之一,后来,他把这个思路搬到了 3D 我觉得这个跟今天的速度,整个的历史也是一脉相承的。所以你可不可以简单跟大家介绍一下 image net,它当年给机器看海量的带标签的图片。这个当时在整个机器人业界,它是一个什么样的意义?为什么它会成为整个 AI 爆发的一个导火索?

08:00 2

苏浩求学生涯里面的话,其实一共有 2 个 PHD。其中大概有将近四年的时间的话,他是在李飞飞老师当时在普林斯顿,后来在斯坦福的实验室里面核心的项目。就像您讲的,实际上是做 image net 的大的项目。他曾经跟我讲过,飞飞对于整个 image net 的推动和架构的话,实际是非常有远见的。但核心总结来讲,就是一个能够复现世界上典型物体的二弟的图片和它的文字。用一个结构化的方法去描述这样的一个基础思想。比如说我们在桌子上的杯子,我们需要一系列的典型的图片去描述世界上几乎所有的杯子。但是同样的款式的杯子,一张或者两张图片可能就够了。

08:43 2

这个思想在 2012 年 13 年,他的第 2 个 PHD 的导师就 6 gibus 的在斯坦福的实验室里面开始的时候,他也把这套思想带到了三弟里边来,所以他那个时候开始组建三弟的大叔。以及 shape net。当然后续的话还有一些非常关键的工作成果。比如说像激光雷达,以点云为表示的表征方法,这个 PONET 都是它的核心工作。但回到三弟大数据集 shapkin t 的话,其实它最大的挑战就在于相比于 image net,你可以把互联网上面几乎所有的图片和它下面的文字描述和标题梳理清楚并且找到。当时用亚马逊最早的话,我记得应该是在普林斯顿的时候,他们用 mechanical turk 以众包的方法的话去做标注。但是三弟的模型其实是非常欠缺的这实际上是一个最大挑战。

09:36 1

我理解李飞飞当年他的 ImageNet 为什么这么火,是因为本质上他当时也是在用一个堆大规模的数据,然后让机器识别。其实有一点点像今天的 scaling 落,只是在那个时间大家还没有意识到,我可以用一个规模化的数据库去解决机器识别的问题。他自己做了一个大规模的数据库,我觉得在当年那个年代还是非常有创意、有想法、有远见的思想,把这个思路搬到 3D 领域。就是我能想象,比如说你二弟,你刚刚提到我们要在一个图片里面去识别这个杯子,它就是一个杯子,我只需要一个标签。3D 的话就比如说我们今天在录音的这个办公室,杯子放在一个桌子上,然后桌子上还有手机录音笔。首先是它的标注维度会大很多,但是你的文字标注它怎么去解决这种空间的物理关系,甚至是力的反馈。我觉得这个事情听起来要难很多。

10:36 2

对这里边的工作其实要复杂很多。所以愿意去做 3D 的大数据集的人,相比于 2D 以及语言的大数据集的话要少很多很多。三弟其实在大数以及里边的话,我们有一系列的工作。第一个核心工作其实是苏浩在 3F 第 2 个 PHD 期间的。我核心工作之一就是 shape tet。Shape net 的话应该是有几十万个三弟模型,但实际上还远远没有达到像 image net 能够覆盖世界上所有物体的所有的模型。

11:08 1

ImageNet 当时做到那么大规模,他们收集了多少数据?

11:12 2

最后应该是有 1400 万张图片和文字的映射。

11:16 1

Ship net 几个人的规模,现在做到了几十万的 3D 数据。

11:21 2

对但是当时的一个约束就是你要找到开源的可以用的 3D 模型。但这些 3D 模型的话,理论上它应该跟 image net 类似。它还是需要一个上千万级的物体几何,能够把它整个的三弟的几何,包括刚才您提到还有很多,比如像材质摩擦弹性的形变的参数,包括我们现在做的椅子,它其实轮子和椅子本身其实还是有很多的动力学的约束。所以这个三级数据集的 shape net,它只有基础的几何和基础的表面贴图。

11:56 2

我们大概能够预估到它的这些物体的材质。因为比如说杯子大概的话就是玻璃、塑料、金属,它是会有一个范围。但再往下一步的话,同样的一个物体的话,它可能会分不一样的 pass 和组件。比如说我们拿到一个饮料瓶子会分成瓶身,瓶盖围绕着这个 label 和标签。有的时候的话,你甚至需要标注瓶身上面哪个是它的瓶底,这些其实是对于 pass 的标注。但飙到 PaaS nee t 的时候就只有几万的物体了。

12:27 2

我们从之前的 shape net 再去做一定的筛选,去做标注。因为这里面要涉及到大量的人工,这时候就会对数据的标注的成本有非常高的一些要求。但再进一步,比如说对于这个瓶子,它的瓶盖究竟是往左拧还是往右拧?它拧动之后的话,能不能够把它给拧下来?这个就叫动力学约束的一些标注,这个数据集叫 internet mobility。现在为止如果我没有记错的话,还是开源里边最大的带 parts 带动力学约束的开源数据集。但这里边只有不到 3000 个物体带有标注的这其实对于几个方面,包括像机器人的合成,数据的训练生成,像现在我们讲的视频生成,里边带有连续的空间物理学性的话,其实都有很大的约束。

13:15 1

Ship net 是从什么时候开始做的?

13:17 2

应该是在 2013 年 14 年的时候。

13:21 1

对我们说之前让机器去做 3D 数据的收集,可能标注是一个很费时间成本的事情。那现在因为我们在考虑大模型跟机器人的训练方法。比如说我让他现在用 shape net 的这一套开源数据集去训练,跟直接对着视频网站成千上万的开放世界的视频去训练。因为他能拿到的数据是更多的,然后那个视频里面也是有一致性的。这些动作的它的核心区别点。

13:50 2

是什么呢?我觉得这个核心区别在我们看来就是 2D 的图片和视频里面三维的信息有,但是不太全,也不太准。这其实也是在 sora 当时在 training 的时候,管线里边其中之一就是用 a real 引擎和 unity 引擎。

14:06 2

从三弟的模型里面渲染大量的二弟的视频和图片,然后再反向来去做训练数据集。但由于互联网上的数据当中太杂,它的三弟的信息其实并不是特别的精准。如果你拿它用来做,比如说像自动驾驶导航,它可能对精度的要求没有太高。比如说你只要求有一个大概 10 公分左右的精度是够用的。但是对机器人的操作,10 厘米的误差是绝对不能忍受的。像我们面前的这个录音机,我们要把线缆插到对应的孔位里面去,那么他的要求必须是在亚毫米级以内。

14:43 1

所以这个只有 3D 建模的 3D 的数据集可以做到。尤其是在机器人的操控方向盘。

14:50 2

对机器人不管是用哪一种方法,但是对于我们做仿真 sim to real 的这条路,我们是要求机器人对于物理环境里边的物体和环境,对于几何有比较精准的理解。那么它对于几何的精度的理解就得到毫米级甚至亚毫米级才可以。

15:09 1

所以现在 shape nee t 它是一个开源的数据集,还是说它有分层,有一些开源,有一些闭源。

15:17 2

Shift net 点 net mobility 都是开源的数据集。但我们自己内部用的肯定不是这些开源的数据集。

15:25 1

您觉得苏浩在做整个 shape net 以后,现在开始跟你们一起做速度机器人,在这个中间沉淀下来的最核心的资产是什么?

15:35 2

这我觉得是一个特别好的问题。走 same to real 这条路,它有点像波音造飞机。很难讲其中是发动机更重要,还是说航电系统更重要,还是说材料更重要。它是一个比较复杂的系统工程,所以怎么能够把搭这个复杂系统工程的团队给建起来,我觉得这是我们团队的最核心的积累。我们团队里边的小伙伴们,在苏浩的实验室以及我们成立公司之后核心的这几个大组的负责人,其实都在一起工作过七八年的时间。

16:11 1

了解人,还有过去做这些事情的经验跟方法论,这个是无可比拟的优势。

16:17 2

对对对,我觉得是的。包括数据,比如说我们在做仿真器,其实大家能够想象到的市面上的核心的机器人的仿真器,不管是像 isac 某、周克,甚至说新创的一些公司,都跟我们有千丝万缕的联系。

16:33 1

对我先跟听众解释一下,seem to real, 这会是我们后面会反复提到的一个名词。他的意思直译就是说从仿真到现实,它是让机器人先在电脑的这个模拟的虚拟世界中训练。然后练成之后,把学到的这件事情搬到真机上,让他在物理世界里面也能用。

16:57 1

大家注意,重点其实不是说说仿真这两个字,而是搬的这个动作能不能直接把它搬到现实世界,还灵不灵?它是这条技术路径上最大的一个难题。英伟达的 isec 仿真平台就是这个路径最大的推手之一。与它相对的另一条路径,就是跳过仿真,直接用真实世界采集的数据来训练。比如说让人去手把手的教,然后机器照着学。所以我听下来你们算是这个领域开山之派的这种感觉。

17:32 2

我觉得一定程度上讲肯定是这样的。比如说像具身智能 MDAI 的英文的提法,应该是 2019 年苏浩跟很多北美的教授联合提出的一个有测评标准的新的研究领域。像屈身智能的这个翻译,也是他的当时一起合作过的某一位教授回到国内去之后,找他一起讨论和商量定的这样的一个描述。但用机器学习的方法去做机器人控制的,我觉得他是跟 sergey 他们应该是同一波。在那个时候的话做探索的非常早。

18:07 1

所以你们公司成立是在什么时间?

18:10 2

速度?公司正式成立就是在去年上半年,但我们以一个商业化和半商业化开始组织是在 2022 年下半年开始的。

18:21 1

我记得苏浩其实是非常早就出来拿他这个 ship net 整个的一套思想,他有在做跟机器人跟 3D 数据集的一系列的探索。那个是在什么时间?

18:34 2

应该是 2012 年 13 年。他做这个决定是因为在 im GINET 出来之后,他自己有一个想法是要做一个类似于神经网络的架构。但当时跟他配合的人没有那么多。在 image det 的挑战赛,alex det 横空出世之后,对他的冲击我觉得是非常大的。他觉得自己错过了,可能是错过了一个非常重要的一个机会。所以他自己就在思考下一站大的领域是什么?所以他想把大数据集加神经网络的方法带到物理世界里面来。所以在他拿到第一个 PHD 之后,在刘格维斯教授组开始搭建新的三弟的 learning 的团队。

19:19 1

对,好早。这个中间我觉得不管是机器人,还是我们说现在的 AI 它的技术已经经过了特别多轮的迭代了。比如说生成式 AI 就是一家刚刚在录音前,我们还有一段时间讨论过机器人界的历史。为什么在前几年,包括在 1213 年那段时间,甚至更早的一段时间,大家投资机器人都是不赚钱,甚至是一个失败的投资项目。而且那个时候其实硅谷有非常多好的机器人项目,像什么 covariant.

19:49 2

我觉得这是一个非常好的一个问题。我们其实也在创业初期受到了上一波大家对这个问题的影响。从一二年 13 年开始到 15 年、16 年,当时应该是我们叫 android 之父 andy rubin 加入 google 之后,他负责了 google 的 X 这个项目,当时应该收购了非常多家的机器人的公司,最知名的可能就是波士顿运动力,后来又转手过很多次,包括给搜半个软银。现在主要的控股股东可能是现代。但也有像您刚才提到的,像 workers intro c 现在还在 google 里面的 robotics,它的硬件部门已经被关闭掉了。但当时那波,可能大家还是想用机器学习的方法往前去推进。但当时的要素我觉得可能还不是特别全。

20:40 2

在 2022 年我和苏浩开始讨论,他有这个想法去做机器人的底层操作模型的公司的时候。我们当时讨论最多的一点,是什么原因能够促使大家觉得现在的机遇跟大概七八年以前明显的不同。当时我们的决策的核心原因之一。

21:00 1

就是大力的出现文生图。

21:02 2

对文生图的 OpenAI 的早期的模型,它的核心就在于它让我们意识到 3D 的 shape net part net 它只有几十万的模型。但是图片实际上是有,比如说像 image 的 coco 这些,它其实是有上千万的,它可以描述整个世界上的几乎所有的物体。有没有一种方法能够把 2D 升级到 3D 来,实际上是有机会的。从一个朴素的想法来讲,就是在仿真器里面如果是要做一个仿真 model,要重建整个世界的物体和环境的话,理论上是开始可行的。

21:41 1

我们刚一直在提你们在走 seem to real 的路线。你的 seem to real 的底层应该是一个我理解现在可以说是世界模型或者是 3D 的大模型。

21:53 2

我觉得一定程度上的是对的。其实现在我们推动 CPMI skill 开始应该是在 18 年 19 年开始的时候。相比于之前的可谓的有限元仿真,比如说像飞行器和汽车制造里面,我们要做流体力学仿真。以前的机器人的时候,你要做机械,包括力学的方针。但当时的环境是我们只需要在一个大型的机器上面当中开一个环境,让它跟真实的机器或者是飞行器也好,车也好,机器人也好的话尽可能的接近。

22:25 2

但新的机器人的仿真器的它的设计思路都不太一样。它并不需要我们在一个大型的机器或者是一个大型机群里边无限去逼近一个真实的环境。反而是用不一样的思路。我们需要在比如说一张 GPU 上面的话,怎么能够开出成百上千甚至上百万个并行的环境。但我们的要求是不需要让它看起来非常的真实。比如说它的分辨率,真的你要去看这个仿真器里面在做训练的时候,它分辨率其实非常低。但是它要求物理的一致性当中的话尽可能接近,但并不需要无限的接近。他一定是要在真实和效率之间做大量的取舍的设计。

23:13 1

所以你们选择了在这个仿真器里面更多地遵循整个世界的底层的物理法则,牺牲观赏性跟分辨率。

23:22 2

我们把经典牛顿力学,包括这个物理仿真里边的很多人类总结这么多的公式都带入到方程器里面来。但同时我们又给它大量的开放世界三弟的物体环境任务的数据,让机器人在里边做强化学习。

23:40 1

所以你们现在 seem to real 的这条路线,包括仿真器的设计,我理解它所有的环境搭建都是为机器人服务的。机器人对一件事情的理解,你们可能是不局限于我要去拧一个矿泉水的瓶盖,而是说我想让机器人做所有的他能看见的现实世中的环境,它都能操作。

24:01 2

我的理解是对的吗?对,简单来讲就是我们想把人类和整个生物对于环境的理解,交互物体的操作,几百万年的进化的过程放在仿真器里面来,让机器人在经历完整的进化的过程。

24:17 1

数据从哪里来?

24:18 2

有几个方面。第一就是我们刚才提到的物体。比如说我们怎么能够建一个跟 image net 一样的 ship net,怎么能够把世界上典型的物体都能够用三弟的表征在仿真器里面去做呈现。我理解之前。

24:36 1

shape net 的那一部分已经开源了,你们现在在做一个自己的 shape net.

24:42 2

对,或者讲就是给机器人用的一个更加完整的高效的 3D 物体的数据集。

24:47 1

对。然后你们这一部分是现采的,现在大概有多少数据可以公开。

24:52 2

这个我们暂时没有办法正式对外透露。但相比于 shape net 以及开源的,我们叫结构化术,以及和非结构化数据集。比如像 image net t shape nee t 都是结构化数据集。我们指的是说它是分类别,每个类别里边的子类都有对应的标签。还有一些是非结构化数据集,比如说三弟里面其实也有非常大的数据集。有一个叫 paul Allen 做的,Allen include 他自己在主推的 object worse 将是有上千万的数据集。

25:22 2

还有其中之一的方法,就是把 github 上面所有的带有三弟的文件的项目里面所有的文件都挖出来。但那是一个非结构化的数据集,里边可能大量的都是。比如说像游戏里面出现的人物的盔甲、武器。但您可以认为这些的三弟的文件大量的重复的对于机器人做物体操作的话,其实用处不仅很大。所以我们自己要建物体的带结构化的数据集是非常关键的。但它的挑战就在于说有很多物体是没有 3D 文件的。当然 2D 到 3D 的生成实际上是一非常有效的一个手段。但现在迭代这么多年,在过去取得猛进的进展,但现在还有一些是需要人工做建模标注和参与的。

26:05 1

你怎么评价你们公司的这一部分数据的质量?就比如说普通好,非常好,这可能是几个不同的等级。你觉得现在在机器人的训练中是用极高质量的数据更关键,还是说我需要用更大规模的数据,但是这个数据的质量可能没有那么高,就是你怎么看这两者之间的权衡?

26:27 2

对我觉得这是一个特别好的问题,我们也没有标准答案,永远是在质量和规模之间要取得平衡,但规模是一定要达到一定程度的。我就有一个朴素的判断,就是你要把世界上的典型的物体,他们之间的组合的环境和要去做的操作任务都有一个结构化的一个描述。你不能只去列举其中的一种形态,说我在找类似的 100 个和 1000 个,1 万个就能够累积到一个结构化的程度。这几乎在机器学习的历史上,不管是说二弟的视觉,还是像自然语言,还是说自动驾驶里面,其实都没有出现过。所以三弟里这样式也是类似的。

27:12 2

在仿真器里边我们要搭建的结构化的数据集是非常关键的。但我们也清晰的知道不太需要无限制的准。比如说单个饮料瓶子,它的材质的具体的描述,包括它的表面标签上面文字的信息,它的图片需不需要百分之百的还原,其实是不需要的。但究竟怎么取得这样的一个平衡的话,实际上是每家可能都有不一样的理解。

27:39 1

OK, 所以你们的数据集算是一个什么样的质量?

27:42 2

我们对于结构化的理解的话,应该是在所有的团队里面可能做得最好的。但另外一点我们也知道,结构化的下面我们还应该去补哪些数据,所以他有没有搭完呢?肯定还没有。比如说我们瓶子要怎么去拧,这对于动力学约束其实还是整个行业里边最欠缺的数据。

28:04 1

然后我们刚刚讲了 seem to real,你们的这个仿真器跟大脑的这一部分,我们说 same to real。后面的 to real 就是怎么把电脑模拟的世界放到现实的世界中。因为传统大家来说,机器人界有几派争议,一个就是 seem to real 的这一派,还有一个就是用 real word data 的这一派质疑。Seem to real 的这一派就会认为我把 simulation 里面的东西放到现实世界中,它的效果可能没有那么好。你们其实也有机器人的本体,然后也已经开始操作了。可不可以讲一下你们的执行效果以及你。

28:40 2

看到的 gap。我觉得 sim to rio 相比于主要以真机数据或者是真世界数据采集,包括像 tel ops 尧操作机器人,包括 5 米以动作捕捉设备人去做物体的采集。不管是比如像 5 米的这种夹爪,还是说我穿全身动捕服。第三种,比如说现在大家经常在讲的所谓的 eagle centric 的数据,我以第一人称视角去拍摄一些视频。

29:03 2

但这些方法相比 sim to real 而言,操作起来都会简单一些,但它很难保证某一类操作任务开放世界的泛化性,这个指的是什么呢?就是基础模型一般的描述是你给它一个任意物体,就是不管是说在预训练还是后训练都没有出现过的。它能够以一个非常高的成功率就能够去完成这个任务。假如说是以这个维度而言的话,我们觉得 sim to o 是跳不过去的。因为真机操作动捕的方法异构的方法异构。

29:33 1

是什么意思?

29:34 2

就是以第一人称视角去拍摄,人用我们自己的手,比如说去拿水杯,包括去拧瓶盖儿。但我们其实之前也稍微的提到一点,就是这类的视频和图片,它的几何的理解和精度当中可能是不太够的。所以我们在仿真里边核心就是要重建这些物体和环境的 3D 光处理的信息量。但是如果规模不够,这个其实是很难体现出 sim pro 的优势和能力的。

30:02 1

多大算一个规模。

30:03 2

这是一个很好的问题。我觉得直到我们四月份其实放过一个结果,就是我们叫速度 r one。速度 r one 实际上是我们去年 11 月份和 12 月份一个内部的一个结果。在我们看来这可能是整个的机器人里边尝试用 sym t real 路线里边能够做到 silo shot 的开放世界某一类任务,能够把 SIMTER gap 当中的话给填平的第一次。

30:29 1

好,我们接下来一起来看一下四月份的 demo。

30:32 2

这个视频就是我们展示了连续 1 个小时,我们可能试了一百多个物体,操作了两百多次,但这些物体其实都是在我们的训练数据里没有出现过的。比如说物体失败之后,我们也没有补后训练的数据。所以它是一个对于物体通用的抓取,第一次可以做到零样本高成功率的结果。我们会变换很多的光照环境和物体,到 1 个小时结束的时,我们一共做了两百多次物体抓。

31:03 1

放的操作。

31:04 2

240 次抓放操作对单次对于这个物体做抓放的成功率是将近 98%。但是如果他第一次失败之后,这个机器人还会用一个闭环控制的方法,迅速的再去调整他的策略,就可以做到百分之百。在这个结果发布之后,整个的研究社区里边就有一派的声音,就是说我们肯定也是精心控制变量,包括这些物体和环境,是不是我们在训练里边没有见过。大家对这个事情是有质疑的。

31:31 1

所以你们有控制变量跟在训练集里见过吗?没有,其实完全没有。对我跟大家先简单解释一下,因为大家可能看不到这个视频,你们第一次 demo 的画面是一个机器人站在一个操作台前再去抓不同的物体。然后这个物体包括像饮料的瓶子,还有小零食。每一种的物体在我看来它的形态,包括这个瓶子,它可能是一个椭圆形的,也有可能是一个锥形的这可能对机器人的手他就要求他去抓不同的部位,它才能把它抓成对的,还是很不一样的。然后这个视频的时长是 60 分钟,你们是连续拍摄对吗?对,是的,连续拍摄没有间断,上面显示一共是 240 次抓取。所以大家有质疑是说你们可能是看过这些数据,但其实是没有。是的。

32:20 2

对,所以我们当时就决定说要在公众的面前给大家做一次展示。所以在六月初的时候的话,我们首先在维也纳举行的一块的大会上,我们就首先把这个台第一次带到了研究者的面前。大概我们统计了一下,在几天的会议里面,可能有将近 1000 人左右来到我们的站台前面,用他们自己各种各样随机的物体去做测试。比如说参会的证件,比如像手机、耳机、小玩偶来做测试。

32:49 2

昨天我们其实也刚刚从 CPR 的会场回来,我们也是搭建了一个展台。然后让整个学术界和工业界当时以为我们这个视频可能是处理过的。大家还是在一个非常随机的一个环境之下去做测试。这在以前类似于这种的学术会议上是从来没有人能够做到这样的展示。原因之一就在于它几乎没有给你时间去做准备。比如说之前像他会在学术会议开始之前,在旁边租一个 LB 硬币,把自己的机器人放在那边去收集大量的数据。可能要提前一个月进场,做好处理之后重复去展示。比如说做咖啡的任务已经是非常。

33:34 1

所以它是有针对单个场景去做适配跟练习的。

33:38 2

他是肯定要的对对。

33:40 1

你们没有。

33:41 2

我们是不需要的。只不过这两者的区别之一就在于我们实际上更关注对于物体的基础操作。比如说这种短的技术。

33:50 1

操作的 zero shot,就是一次性抓取成功的单个动作。我理解他做的是连续动作,因为做咖啡是一个。

33:59 2

连续动作。对他就相当于说要把这个连续动作让人去遥控。这个机器人至少要出现过很多次。如果是他换一个咖啡机,或者是同样的咖啡机换一个环境的话,它的成功率肯定会要往下掉不少。那这时候怎么做呢?包括绝大多数的机器人模型公司都还要去再补充一定的数据。

34:22 1

去做拟合。对做单个一次性抓取的任务,跟做一个像甚至我们说很多灵巧手公司,它要做一个长达 21 步的这种长城任务,就是复杂动作的拆解,每一步都需要连续。你觉得这两者之间哪个更难?

34:38 2

我觉得如果是真正做机器人的 manipulation,做操作的社区的话,肯定认为 ZO shot 稳定的。对于开放世界的基础物体的操作,短操作的成功率其实更加核心和关键。长城任务的复线也是非常核心和关键的部分。但其实如果是你的短技能当中足够的稳定可靠,它的泛化性足够高,你其实是可以把短技能拼成各种各样的长城操作的这其实也就是 many skills 的整个核心的框架的大的思想。

35:11 1

所以我理解其实最难的部分是开放世界,而不在于它是短还是长。你只要在开放世界中短的能成功,那么连续成长的它是一个迟早的问题。

35:21 2

对,简单讲是这样。但是里边其实还有很多的核心工作,比如说你要做短技能,串联成长技能,其实也是一个类似于像思维链的方法。其实在 chal sauce 提出来大概在二三年的时候,我们其实也有一个同期的一个工作,叫 chal sauce predict control。就 COTPC 它其实就是专门处理短任务,如何串联成长城任务的,类似于思维链的一个框架。

35:45 1

我看见你视频里面的展示,这个机器人,它是一个两个指头的抓夹。因为我们知道在灵巧手里面大家也分的很细。就是你是两个指头的抓夹,还是说你的手部有几十个关节,然后你可以做一些复杂的动作,比如说在手内转小球或者是穿针引线,这种需要你非常精巧的操作。这两个在训练方式上会有不一样吗?还是说这个是你们。

36:12 2

下一步的目标。其实林教授的话,我们在 2023 年,甚至在之前,我们都有很多研究的一些成果。但一般在做机器人的 mancipation 操作的模型的时候,大家一般会把这个问题稍微解一下。绝大多数的任务其实并不需要零销售的操作。但林销售直到现在行业已经取得了非常多的进步的前提之下,它的稳定性和可靠性其实还不是特别好。包括它的成本其实都没法控制的特别优秀。但是相比于早期像 shadow hand,可能几十万美金一支,已经好了非常多。但到现在为止,因为我们自己用 simulation 可以知道对于物体的操作,比如说像手内转魔方,比如说盘核桃,这些的确是需要多只手,甚至有的时候它不一定是五只手穿针引线,有的时候也不一定需要并销售,它主要还是看成穿针引线。

37:03 1

可以直接用机器。

37:05 2

对对对,所以我觉得您这个提的特别的关键一点,就是肯定零售者是最为通用的。但是对于稳定性和可靠性,以及一开始大家在做探索的时候降低变量的话,林教授是一个选项,但不是一个性价比最高的方法。对。

37:22 1

因为今天我们录播课的时候,其实我是第一次看你这个 demo。我知道你有更远大的梦想,就是你想实现更加开放世界的通用的机器人的操作。但是我直接看到这个 demo 的感受是,这跟几年前像 carrots,包括像 covariant 想做的东西非常的相似。但是其实我也跟他们内部的人聊过,他们当时没有办法做到这么稳定。

37:47 1

我看他们当时的那个 demo 场景是什么?就是说我把一堆丝芙兰买到的女生的化妆品的小样,什么唇膏,就是各种小东西放在一个筐里。我就让这个机器人去抓取,看他抓取的成功率,其实当时他的那个成功率不是很高。然后我们也知道亚马逊他其实是收购了 covariant 的核心创始团队。我能想象这个场景,基于仓库物流的分类,它已经是有超级多的工业应用场景了。所以在商业化上,虽然我知道你可能还会有一个更远的梦想,你会考虑在一些垂直的应用场景开始去做一些商业化的部署吗?

38:24 2

对我觉得这是一个特别核心的商业化的思考。我们的策略实际上是认为机器人的各种各样的行业的应用有非常多。作为我们自己一家公司,第一是做不完,大概有成千上万甚至上十万、上百万不一样的机器人的应用。应该是由每个垂类的应用最理解的这样的一个团队去做推动和参与。

38:47 2

我们自己在里面的定位是,比如说我们刚才看到的抓物体,包括之后我们再推出的一些技术操作技能,应该把它排列组合的能力给到每一个想要拿他去亚马逊里面做各种各样的化妆品的分拣的,也可以做玩具分拣,也可以做零食分拣。同时他也可以拿到工厂里面去做零件的上下料组装,也可以进到家里面。比如说把我们吃完饭的桌子收拾干净,我们希望我们能够做到的是一个底层基础短技能的稳定可靠的基础模型。提供好 API,并且能够把这些基础技能拼成各种各样不一样的长城的任务。但它的要求就在于大家有这样的想法,搭成类似于像大语言模型里面的 agent。

39:35 2

我们有一个新的描述叫 adapt。他其实是可以把我们对于比如说今天我要在这个会议室里面给我们再拿一杯咖啡。我可能是要从旁边的屋子找到咖啡机,按好那个按钮端杯子来,中间还要经过两道门。那么这个任务我们希望在任何的办公室里面都能够完成,但他只需要用同样的一套逻辑就可以。这一类我们管它都叫机器人的上层应用。这一类的上层应用,我们就希望大家用我们的机器人的完整系统,包括本体和底层模型搭出来这样类的应用的时候。假如说我是上层的开发者,我坐的往会议室里面去送饮料的这样的一个应用,可以在任何一个办公室都可以起作用。

40:19 1

对大家跟你买的是什么呢?买的是一个机器人的本体加上模型,加上 API 的调用次数。

40:25 2

简单来讲是本体加我们的软件支持上层的应用,实际上是开发者去做开发,我们也可以帮大家去做二次的分发。这个模式其实就回到我们怎么认为机器人的商业模式。假如说是从硬件的形态而言,它更接近于汽车里边有大量的像电池、电机。它的计算单元相比于汽车而言,它的体积会更小一些。但是从结构上会比较接近。但是从商业模式上而言,我们一直内部认为它更像是智能手机。

41:00 2

会有公司去提供一个像 iphone 或者是像 android,它有一个硬件加一个操作系统,它有完整的 SDK。开发者就在上面去搭各种不一样的应用,可以贴牌。但更重要的是有人去做 uber,有人去做 doordarshan。比如说像国内就有人做美团,有人做滴滴,同时还有人会去做 instagram、小红书各种各样的应用。

41:24 1

我开始听到你这个商业模式的时候,我本来想把它比喻成一个安卓手机。但是我后来想了一下,如果说你们是一个安卓操作系统的话,还缩小了。因为他的手机是可以自己制作的操作系统,它只是买软件。但是我理解其实你们现在卖机器人的整套的话,你其实是需要硬软件一起卖的。因为机器人的硬件跟软件,它是一个操作的整体,它很难说他买一个软件放在一个新的机器人上,它能适配。

41:51 2

对,这其实还是可以 echo 一下您提的前面的一个问题,就是说 seem to roll 的 gap 怎么搞?核心的原因怎么能够去写的比较好。就是你的硬件和软件要一起设计,包括我们仿真器里面去仿的这台的机器人有两个要求。第一个是仿真器里面也不是万能的,我们可能有一些构型或者是某些的组件和元件,现在还没有办法仿的特别的好,或者是还没有来得及去做处理。这时候我们就需要让这个机器人在做硬件选型和构型的时候,用仿真器支持比较好的方法去做设计和搭建。

42:28 2

第二个就是硬件本身它也有各种各样差异和噪音。即便是我们自己在设计同一款机器人的时候,每台个体都有差异,这是不可能百分之百填平的。包括单独每一台机器在每一次上电的时候,它的表现其实也都不太一样。这时候就在仿真器里面的话,要对于这些噪音和差异做一定的仿真。但这个前提都是你不能差别太大。

42:56 1

了解。所以我理解 seem to real 的这条路径就是它一定要跟机器人的本体是绑定在一起的对。

43:03 2

我们觉得是强绑定。虽然在我们成立公司之前,我们做开源的 CBMSQ,包括像 isag,大家都在强调说我可以支持各种不一样的构型。但我们想讲开源的这些方法都是研究的方法,它其实上是极度的简化了。比如说像机器人里边导入到仿真器里面,它用的像有个叫 URDF 的格式。那么它对于它的几何动力学约束都是做了一定的简化。它其实不太会考虑到像电机的控制里边,它的噪声,它的响应曲线的尺寸,包括每次上电的时候的差别。这些其实在研究界大家可能还没有办法去考虑到这么多的细节。但是你要做一个稳定可靠,可以解决 senior gap,并且可以在开放世界里边有足够可靠稳定的能力的这样的一个机器人的时候,我们就要把它当成一个综合系统来考虑。

43:55 1

所以靠跟硬件的整合,它是一条解决 gap 的路径。还有其他的方式,比如说在软件层面的调控的解决路径吗?

44:04 2

对我觉得就是所有的方法都要有机的结合在一起。比如说像数据的规模和它结构化的规模,包括如何能够把它的仿真的效率拉的更高。比如说我们用不用真实世界的数据去做训练。的确也有。比如说在仿真里边,我们也会让机器人去看人去做操作的时候,哪一种方法更加的高效。

44:26 2

我还是拿这个瓶盖举例子,机器人的强化学习,假如说是你要让他把瓶盖拧开,你会发现机器人一开始它可能碰的都不是瓶盖,它可能会碰饮料瓶的标签或者是饮料瓶的底部,甚至往上稍微的推它一下。但这些在早期的强化学习的探索的话,其实都是一些相对来说比较随机的探索。但是你如果让他看一段人的操作的话,比如说人在做瓶盖操作的时候,是接近于这个瓶盖,然后在附近去做了一些动作的时候,那么它的强化学习的效率也会更高一些。这些其实都是在强化学习框架的设计,特别是 model SRL。最难的其实就是在于这部分,你怎么能够给反馈设计的好,甚至是说怎么能够把它批量自动化。

45:14 1

而且我觉得机器人手去拧瓶盖的难度,跟你在仿真器里面让机器人自己运动的这个难度还是完全不一样的。因为你那个手拧的不管是角度还是你控制的变量,它差 1 厘米,它的区别就非常大,不用 1 厘米了,几毫米。

45:31 2

对您刚才提到的这一点其实是非常核心的一点。仿真里边的强化学习和 CM to real 其实已经在类似于像波轮动力和语数这样的人形机器人和 4 足狗的 local motion 的控制已经得到了充分的验证。是而且比如说使用英伟达的 Isaac,其实里边的有一部分的强化学习引擎也是我们团队成员在早期贡献的,大家都有些参与。但机器人如果是要对于物体去做操作,它这个难度要高 2 到 3 个数量级。

46:00 1

你说操作层面上的,就是你停靠的这种,包括跟桌子上的很多东西的一些交互。对,这个很有意思。因为我们上个月有一个线下的英文论坛,当时正好是英伟达它有一个证明,就是 seem to real scaling law 起效的这样的一个方式。就是说我用 seem to real 可以在现实中真的去控制机器人的运动。他们那个研究成果刚刚出来,然后我印象还很深。我当时还在我们线下的活动上还问了英伟达的科学家。我说你这个控制大运动听起来是已经可行了了,但是控制灵巧手这个是不是还是一个很关键的没有被解决的问题。然后我觉得我今天跟你的这个聊天,好像正在找到这个问题的答案。

46:40 2

对我觉得我们之所以提这个难度要高 2 到 3 个数量级,就是因为如果你只是需要关注自身的动作的话,你其实不需要对世界有理解。你不需要知道这个物体的形状,不是需要知道它的材质,你也不需要知道我怎么能够移动到这个物体附近,并且在接触到这个物体之后怎么去做适度的调整。对于这个物体的操作而言,它的难度就在于它首先要构建一个结构化的一数据。这个在 local motion,比如说做姿态控制,实际上是并没有这个问题,他只需要关注机器本身。是的。第二,它其实对于环境的理解和做所谓大家现在讲卧尔 model,其中有非常重要的一支就指的是机器人对于物理世界的理解和推理预测,这些其实他们也不太需要。

47:28 1

所以你们的机器人是真的理解物理世界吗?还是他只是说数据训练的多,他不用管为什么它就直接输出就好了。

47:37 2

我们的这个模型相比于另外一派,比如说 fix zoom intelligence 主要在推的狭义的 VLA,就是以模仿人类动作这样一个端到端 n to n 的模型而言的话。我们是要对于物理世界、物体和环境以及它未来的变化要有强理解和强预测的。它并不是一个黑盒的模型。那么对于我们底层,我们一定要知道我们的机器人在移动过程中,包括开始跟物体接触前,接触过程中,它的每一个推理和判断,包括它的未来的预测,都是要有认知的才可以。

48:12 1

你刚刚提到你们的模型不是一个黑盒模型。

48:15 2

我们其实并不是,它是可解释的。我们为什么要对物体去接触和操作,为什么要去做调整,其实都是可解释的。比如说我们对这个杯子去抓,一开始可能没有抓起来,或者是拧这个瓶盖都没有拧动。那么我们会大概知道它的下一个预测状态当中是什么样子,但核心的就是闭环控制。当手接触到这个瓶盖的时候,用两个手指用一个小的力量去拧的时候,它没有拧动。可能会出现两种情况,一个是需要继续去加大力,还有一种方法,可能某一个国家的它这个瓶盖的左旋和右旋的设计可能就不太一样。

48:51 1

了解,然后我看你们那个 demo 是抓取物体,抓取物体跟拧瓶盖,我理解他对机器人的操作上要求还是不一样的。

48:58 2

对,还是不太一样。我们其实是这样来定义的,就 many skill 在 2020 年左右开始推出的时候,就是把机器人的底层的技术操作分成了一些类型。包括它在过去的这五六年的时间,到目前为止应该还是机器人做物体操作里边最大的一个挑战赛和奔驰 bug。里边的任务会分成,比如说物体的抓放,包括一些带有触觉的插线接插组装等等。当中的话很多的任务大概有常见的比赛里面一般会设置十几种。

49:29 1

你刚刚提到了你们不是一个黑盒模型。但是我理解现在硅谷最火的这些公司,像 physical intelligence skilled,他们做大脑就是纯做软件层模型层的这些公司。我理解他们还是在尽可能的去搭一个黑盒的模型,因为他还是在遵循现在这一轮的生成式 AI 崛起的一个范式。就是说我对的数据量越大,我的机器越智能。我未来赌的是一个通用跟开放场景的智能的程度。我之前也有跟一些做机器人的人聊,就是为什么白盒模型这么多年没有起来?就是因为人可以预测跟想到的情况是有穷尽的,同时你很难去解决很多场景的 corner case 的问题。所以到底搭白盒还是搭黑盒,你们是怎么想的,以及未来的评估。

50:14 2

是怎么样的?我们是模型在预训练的过程中是有分层结构的。就是说我们需要在预训练的时候的话,让机器人知道它对于物体未来所在的环境里面,要对几何材质和它的运动学。包括我做操作的时候,预测是要有一定的推理和认知的。但是最终在端侧部署的时候,我们也是一个端到端的模型分层。其实在预训练。

50:38 1

的时候当中是大脑跟软件的那一层。

50:41 2

我们让机器人在我们的仿真器里边要对这个物体知道它所在的几何位置,包括对于它周边的物体之间的一些材质的预估,重量的预估。它有没有没有知道它实际上是分瓶盖和瓶身的,大概去操作的时候应该是一项,比如说逆时针旋转,这些其实都是他有理解和推断的这。

51:02 1

一段是黑盒。

51:03 2

这段相对来讲是一个以一个隐式表达可以去描述的。它大概在什么样的位置,有些是显示表述,有些是隐式表述。但比如说像硅谷和国内绝大多数的机器人公司,在以模仿学习为主的这样的一套思路,它其实是不太需要知道物体究竟在环境里面它准确的位置,他也不太需要知道它的几何的信息。比如说我们刚才讲的拧瓶盖,它其实并没有一个推理是说我需要向逆时针的方向去做旋转。他之所以这么做,包括去接近,都是因为在那个环境之下,曾经有人是遥控这个机器人,或者是用自己的动不符做了那样的动作。他只是在纯粹的机械的去模仿,他其实并没有特别强的理解。

51:49 1

所以你们在搭建理解的这一部分。

51:52 2

对我们是需要在预训练的过程中是有理解的。但人类其实在对瓶子操作的时候,我们其实并不会在脑子里边有一个推理过程。说我这次拧这个瓶子的话,我要用一个逆时针的一个策略去转。

52:06 1

这顺时针转不动就逆时针。人类是很可变的对。

52:10 2

它是可变的。但是它也有一些常识,比如说我们每次去拧瓶子的时候,我们一般都是逆时针去转。因为这是一个常识,已经是刻在了我们自己以前的肌肉操作里面去。但假如说是小朋友第一次看自己去拧一个饮料瓶子的时候,他会经历两个阶段。第一是他假如说从来没有看过父母去做这个操作的时候,他会先往左拧一下试一下,再往右拧一下试一下,它是一个随机的一个尝试。但同时他又会去观测父母是怎么去做操作的,他可能会有一些理论依据。

52:47 2

人在出生之后,他带有一定的对于物体的操作的能力。比如小朋友出生之后长大的过程中,他对于所有的物体的话都会去抓抓咬咬拧一拧、掰一掰去试一下的时候,有些运动的能力其实也是刻在人遗传的基因里边。机器人我们实际上是要把整个进化的过程在仿真器里面再去复习一次。

53:08 1

你们会把人类的进化过程在仿真器里面。

53:11 2

其实是这个太有意思了。这个仿真器之所以当时租号起名字叫 CPET,其实就是尤里赫拉利写的那本书。CPES 的映射,它其实就是指的怎么让智人从猿到人一个进化的过程。

53:26 2

但为什么我们选择这个模型的进化的策略,跟另外一派说把数据堆构的策略最大一点的不同。核心原因就在于机器人的数据堆构的方法跟自动驾驶,包括二级图片视频,包括自然语言一个最大的不同就是它没有足够多的数据。自动驾驶可能是最接近的,参与到这里边的自动驾驶的人非常多。但是它的一个核心在于自动驾驶。比如说 tesla 在可能十几年前就开始卖他的车,当时绝对没有现在的 FSD。虽然他当时给大家画饼说未来可能会有 FSD,但实际上是有几百万的司机买了他的车,在 101 的公路上面天天开。

54:09 1

所以它是会变的,它不一定要只遵循一个范式。我可以在数据不够的情况下,用白盒加黑盒的模式搭,等数据量够了,我可以去改变我的技术。

54:20 2

但是机器人你是很难同一款机器在没有任何功能之前,我卖 500 万台机器人到各个办公室、家庭或者是工厂里面去。并且旁边还有一个工人在遥控他去做各种各样的操作。在我们的家里面,我们很难想象我买了一台机器人,我需要穿着一个动捕服才能够去做西红柿炒鸡蛋。这个我觉得基本上是很难。

54:42 1

这在说完。

54:43 2

X 吗没有特质。对。但这个模式实际上就在于说我们人类以公司方法去做组织的话,我觉得像国内的公司已经做的是非常超前的。可能已经能到百台甚至千台以上的规模。但它离 500 万台和 1000 万台,并且能够进到每一个家庭,每一个办公室。就像特斯拉的车,实际上是开到了世界上几乎所有的角落,收集到各种各样的数据,并且后面还有一个司机天天帮他去标数据。这些的要素在机器人里面可能都不成立。所以它的冷启动的方法就是像您刚才提到的,英伟达提到 sim to real。

55:23 2

为什么一定是要推的一个方法是躲不过去的。就是因为它能启动的数据,实际上是需要一个百万甚至是千万级别。在所有的开放环境里面都要把这个数据给收集全才可以的。

55:38 1

所以我理解这是你们用分层模型,而不是硅谷主流的端到端的一个核心原因。在现有整个业界机器人数据都远远达不到的情况下,我们可以通过分层让机器人先跑起来,先提高它在开放场景 zero shot 的操作能力。然后你们的商业模式,比如说你现在是卖给很多开发者,当大家都开始用这些机器人,其实后面你还要不要用一个新的方法去搭,你的训练范式是可以变的对。

56:10 2

稍微分享一些我们自己认为的一些小八卦。Physical intelligence 在成立之前,他们其实是在 google,包括 journalist 的这个实际上是在 google rodi s 里面工作的,非常多的核心人员参与的。那个时候的话,大家可能都是做一个端到端的一个模型。但再往前,当时大家有一个默契,就是有可能是底层的模型,有一个稳定可靠的底层操作能力。再向上,实际上是有大家去做环境理解,包括拆分成不一样的任务。我怎么能够去那个咖啡机,然后拿到两个杯子,倒两杯咖啡,中间还得过两道门。但在大家二三年、24 年先后开始搞公司的时候,大家就选择了自己擅长和熟悉的套路。所以他们可能就不再提分层。但我们有一个暴论,就是可能从今年的下半年开始,上下分层的这种结构会重新再回到主流里边。而且可能在之后大家选择的方案推到商业化里面去,可能是最终的一个方法。

57:09 1

你可不可以简单一句话总结一下,上下分层指的是哪个上下分层。

57:14 2

对,比如说从冰箱里面拿一个瓶子,把瓶盖拧开,然后把我们俩面前的两杯水倒满。那么上层实际上是说我们现在杯子里面没有水了,我要去重新倒水。机器人实际上是要对于我们现在所在这个环境要理解哪边是冰箱,里面有没有水。我第一步应该去走到这个冰箱面前,打开冰箱门,拿到这个瓶子移动到这边,把瓶盖拧开,并且朝两个杯子里面分别去注入一定的水,再把瓶盖给拧上。这些是属于我们叫拆分步骤的做 reasoning 的过程。但是底层在我们的划分里边,就是我如何去走到冰箱的面前。

57:52 1

把门给开操作的这一层。

57:54 2

抓住这个瓶子移动到这边,把瓶盖拧开,并且往杯子里面去倒水。这些底层的每一步具体的对于物体的操作,我们叫 low level manipulation。上层的这个 high level 的 reasoning 和 planning 当中,我觉得是可以分开的。

58:09 1

所以你觉得今年所有的硅谷公司都开始会做这种分层操作。

58:14 2

我觉得很难讲今年。对,但是这个会回到大家的视野里面来。我觉得在最近几周的时间里,我们在跟学术界、工业界大家做现场展示和交流之后,有些人已经意识到这可能是一个新的方向。

58:29 1

所以我理解现在硅谷的很多像我们说的派 journalist 的这些公司,它还是在把操作的层面也是直接用大模型控制的对,但是现在能做出这个判断,证明现在的控制并没有大家想象中那么好跟成功率那么高。

58:43 2

我觉得是的,仅代表我自己个人,不一定是公司统一的想法。就是我觉得 physical intelligence 和 Jerry 的 google 等等这些机器人公司其实更擅长做上层。The reasoning. 但是对于物体的操作的话,靠少量的,比如说几十万小时,我觉得可能已经是现在操作的极限。人类真实操作物体的数据远远没有办法达到对于物体的开放环境,开放物体的稳定可靠的操作的能力。

59:09 1

我可不可以理解成上层是硅谷公司的优势,下层涉及到操作层面。因为你就一定要跟硬件相结合,这就是中国公司的优势。

59:18 2

或者讲硅谷的机器人公司也好,大厂也好,中国的模型大厂也好,大量的巨深的公司也好,我觉得可能都是像上层做 reasoning 的机会会更大一些。当然还有很多巨深和机器人的公司,他们挑某 1 到 2 个垂直的应用的场景,可能就类似于像大模型,它就做一种或两种的 agent。但是对于底层如何在随机的环境里面,对于一个任意物体做某一类的操作,我们认为必须是一个软硬件强结合的公司才能够达到。但这家公司是不是只有中国公司能做到?我觉得未必。

59:54 1

你们跟像语数这样的公司核心区别是什么?

59:58 2

我觉得语数是在继人的硬件的量产能力,就率先给市场交出了最好的答卷的一家公司。对。

01:00:05 1

2025 年的出货量有五千多台。然后我们对比一下特斯拉 figure 这些美国的明星公司它可能只有 150 台左右。

01:00:13 2

而且语速是把这些五千多台的设备当中真实的发到了用户的手里面。

01:00:19 1

在操作上跟大家关注的方向的不同点上。

01:00:22 2

语速对于物体操作可能才刚刚开始。

01:00:24 1

它主要是在大运动跟运动控制上。

01:00:26 2

对对对,而且对于物体操作,这个人形机器人是不是一个最稳定可靠的一个方法?短期之内不一定,未来可能是。

01:00:34 1

今年我看见最近有一个大热点是 skill 的 AI 它的估值是冲到了 140 亿美元。它最新的一轮融资是 14 亿美元,投后估值是 140 亿到 150 亿美元。七个月前它的估值才是 45 亿美元。它其实就是做全身体的通用机器人的技术模型 skilled brain。对比我们刚刚一直在讲的 physical intelligence,他也算是硅谷的做软件大脑的一个非常有代表性的公司,它的估值也是 56 亿美元。你对这家公司熟悉吗?为什么他一下能拿到这么大的一笔融资,然后估值的规模在大范围的提升。

01:01:10 2

我觉得首先 facial action 如果我没有记错的话,它最新的估值也是在 120 亿到 140 亿美金之间,不一定完全对外公开。但他们也在做新的募资。我觉得这几家公司,包括 skilled python intelligence,包括 journalist 都比较接近,就都做大脑对 skill 的话比较特殊一点。两位创始人 d park 和 alben ough 其实跟苏皓也做过很多的讨论。他们以前是坚决不信仿真的,但是在一开始募资的时候,他们是拿机器人仿真作为他们主要募资的方向。但实际上据我们了解,做的业务可能偏敏感一些。我觉得在做最深技术模型。美国这边第一梯队的话,我觉得还是像 physical en intel gist 这样的团队,包括 generalist 以及还有一些创业的团队。像华人的 Sandy,像戴娜,其实都在做一些探索。

01:02:00 1

然后我们来看一下,最近我看 figure AI 好像又被看好了。因为之前他其实也是融资估值都很高。我觉得有一段时间整个硅谷的投资人,我听起来大家是对 figure 是有所质疑的,甚至也会质疑他放出来的 demo 你是不是后期剪辑过。为什么最近大家又重新看好 faker 了?是因为它跟宝马的一个合作,还是因为它的技术能力跟放出来的 demo 有一个全新的提高?

01:02:27 2

我觉得这轮可能跟宝马的 demo 可能关系不大,因为最近大家对他关注是在大概几周以前,他开始做一个产线里边的物体的分解。但在我们看的确是比以前有一些进步。但在物体的操作放大性和环境的放化性上,其实差别还比较远。第一,它里边出现了两类物体,一个是一个在做实验的一个包裹,但那个包裹其实形状几乎是一样的。

01:02:54 1

都是正方形的对,你是说他一天的直播。

01:02:57 2

对几天,他后来持续了几天。但如果是按照我们的要求的标准,第一它的物体分化性其实不高,因为一共只有两类物体,一个是盒子,一个是软性的包装,而且颜色和重量几乎是一样的。第二,它的机器人所在的工作的环境,一直是在他们自己公司里面搭建的那一条测试线里面,并没有走出去,很难。所以如果是拿咬操作做 VLA 的这套方法的话,最大的约束和挑战就在于它对于光照和环境的变化都极其敏感。一旦变化之后,它的成功率会直线的下降。

01:03:31 1

所以大家对 figure 还是有质疑的,就觉得他的 demo 放出来还是简单。对。

01:03:36 2

但我觉得比以前已经好很多了。

01:03:38 1

洗碗机的那个是他的 demo 对吧?

01:03:41 2

洗碗机是他的 demo。对,但我们听说是花了很长时间拍一条。

01:03:46 1

对对我听到的也是这样子的。另外就是我看见今年还是有很多的机器人公司,他在进入部署阶段的。比如说马斯克就把 optimus 要放到 fremont 的工厂,让他在工厂里面去做一些工作。但是他自己也说了,就是开始大家还是希望他能进家庭,能真正干活的。但是他说他现在放 optimus,他其实主要也是为了训练数据,而不是真正的让他干活。我觉得特斯拉的人形机器人,现在也是大家蛮关注的一个点的。就是从一个专业的同行业创业者的角度,你会怎么去看它的部署。

01:04:24 2

在我们 25 年主力团队搬回到国内之前,其实我们跟特斯拉的自动化团队有一些合作。但是当时他们在自动化产线里边使用的自动化,能够让机器人在里面去做任务的时候,奥特曼肯定是还没有能够能满足那个条件。当时应该只是在 opportunities 团队里面去做一些,比如说像一个固定的位置当中去拿电池的这样的一个动作。但 optimum 我觉得是未来美国的机器人行业里面肯定是最大的推手。因为它的硬件的核心和制造能力实际上是非常强。模型的话我觉得按照 tesla 和 elon musk 的风格,可以等到这个行业有较为好的方案出现之后再去补,可能也来得及。但同时我们当时也听到特斯拉里边可能有一派的声音是说伊朗他自己当时也提过先造一系列的机器人,让外界的人去做研发开发。

01:05:21 1

跟你们的思路有点像。

01:05:22 2

我觉得有点像。但他的思路,我觉得是跟现在很多做机器人硬件团队更像。我不给你模型,我给你很好用的硬件,你自己去开发模型。对,但我们实际上是想要给大家一个硬件,同时有底层大家不太好用的。对对对,这部分。

01:05:41 1

对,然后我看今天波士顿动力电动版的 atlas 也在开始出货了,这个是一个值得关注的点吗?

01:05:49 2

对我觉得这是一个特别关键一点。我们自己内部定义的最大最有潜力跟我们一起去推这个方向的,可能就是不甚动力的电动版阿特拉斯加上 google 的 deep mind。如果大家去年看 demis harb 的一些采访,包括他的纪录片以及一系列的动作的话,我觉得他们对于物理世界 AI 的下注,可能是在所有的大厂里面最坚决的一项。只不过现在他可能还要分时间去兼顾 german I 跟 anodic 和 OpenAI 去做竞争的这样一波。但我觉得去年有一个非常重要的信号,第一,他们已经把硬件的平台从原来的 ACROOC 和另外的一台机器换成了电动版的 atlas。同时,它从波顺动力的硬件部门,把核心的几个人都挖到了你的团队里边。所以未来机器人行业里边,假如说我们走的是硬件也是我们自己造,软件底层模型也是我们自己搞。那么 google 会不会重复 android.

01:06:53 1

的方法再做。

01:06:54 2

一次对用不甚动力的硬件,包括现代集团在后面量产的能力的支是同时他们自己在仿真器在几年以前就收购了某这个团队。

01:07:04 1

自己在做不断的改进他自己还有他自己的世界。

01:07:08 2

模型 G 这些他有几乎无限的卡,世界上最好的人才聚集在一起。并且他是下了决心,就是从公司相比于 subic OpenAI、meta 国内的这些的大厂,可能是唯一一个带团队的负责人,在机器人上面如此的用心的。它可能是未来,对。

01:07:28 1

因为它硬件也有,软件也有,我觉得这个跟其他公司是完全不是在一个量级上的。

01:07:33 2

我们感觉他是坚定的相信 sim to 的这条路的。

01:07:36 1

对我就知道四号的团队跟 deep min d 可能也会有很多的交流,应该你们也是对我们。

01:07:41 2

合作跟 google robotics 4 以前的交流合作的非常的多。甚至说那个团队里面有很多都是他的师弟师妹,有一些核心人员是他曾经的 PHD 的学生,包括 pi 创始团队里边也有。但我觉得 demand 的这波,他会把核心的人才聚集在伦敦,在英国模型团队和硬件团队聚集在一起。这个事情我们觉得非常重要。就跟当年 Steve jobs 说做 apple 的开发的时候,有人问能不能去另外一个办公室,能不能远程,他坚决不同意,我觉得是一样的。

01:08:12 1

所以在所有的机器人公司中,你们最看好的是 deep my 加波士顿动力。

01:08:16 2

这个还是对我觉得这可能跟大家想的都不太一样。我觉得可能在接下来的 2 到 3 年里面,从机器人的操作能力和综合能力上而言,我们认为的最大竞争对手可能是使劲卖的叫波士顿动力。

01:08:29 1

对,因为波士顿动力大家知道最开始是谷歌收购了他们,后来他们又全部卖给现代集团了。所以他现在跟 deep mind 之间关系是怎么样的?还有股权关系吗?

01:08:40 2

现在股权关系应该没有我如果没记错的话,现代集团应该是主要的控股股东,然后剩下的软银应该还是保留了 10%到 20%。但地幔这次不一定会把波顺动力再纳入到体系里面来,但波顺动力会把地幔作为它大脑模型的可能最重要的一个合作伙伴。

01:09:01 1

对,那我们再说一下亚马逊,因为亚马逊其实去年年底我听 all in 的播客,他们说其实有一家公司非常值得关注,就是亚马逊。理由就是说亚马逊马上今年它的机器人的部署可能已经比它的员工还要多了。因为他们其实是有仓库分脸的这些场景,它天然是一个场景的应用方,而且他也收购了 korean。你会怎么看亚马逊在机器人上的布局?

01:09:28 2

我觉得亚马逊一直是在机器人里边投入最多的一家大公司。但它的数量可能还是以比如说像第一像仓储物流里边,像做 HV 像 kiva 很早就收购。包括像各种各样的机械臂的应用,各种各样的人形机械公司,比如像 a covalent 之前可能还有一些其他的公司都在里面去做尝试。我觉得它会提供一定的场景,但亚马逊最终要不然就是要把这些公司收购,要不然就要自己去做。我觉得科 rent 也是当时把亚马逊作为核心的客户之一。

01:10:01 1

刚刚在聊硅谷跟中国的这些机器人公司它的发展过程中,我基本上还可以总结,就是整个硅谷它还是在更加看重机器人它的通用性、泛化性,包括他大脑层面上的这些进展。因为我们看到市场上最高估值的公司全都是集中在这一块儿。中国它有非常好的硬件的底子。但是同时我也看到很多的公司开始可能也抱着说,我们要去做机器人的通用性的这些想法。但是最后他可能因为有商业化的压力,他可能最后都退回到了单一场景。就是你怎么去看这种理想很丰满,最后大家回去做垂直赛道的现象。

01:10:42 2

我的核心的推断还是跟前几轮,比如说像做视觉大模型,比如像当时的 A4 小龙,包括后来做语言模型的科大讯飞等等类似。如果是对于基础模型如何去构建,没有一个特别清晰的想法,只是想边做边是的话,我觉得其实很难。大家都会因为商业上的一些压力去做妥协。但是对于我们团队而言,我觉得也是分成两册。假如说我们对于基础模型如何去推进,也是在摸索,没有较为清晰的一个方向能够在未来的。比如说当时启动的时候,能够在 12 至 24 个月里面应该能够看到什么结果。有判断的话,我觉得我们也未必能够一直坚持这样样的一个。

01:11:25 1

方式和方法。所以你是看到了技术。

01:11:28 2

上通用的可能性。我觉得是这个团队可能在过去的七八年的合作里面,其实已经有了一些感觉和认知。再把哪些要素补充在一起。大家合作是比如说 12 至 24 个月的话,就能够看到第一阶段的效果,我觉得这个比较关键。而并不是说我们把数据先做一些小模型,先试一下是不是把数据堆到一定程度之后什么程度现在也不知道。有可能是 1000 万小时,有可能是 1 亿小时,有可能是 10 亿小时,说不定就做出来了。我觉得说不定这三个字儿在我们团队里面几乎不太会出现。

01:12:05 2

但是对于其他的团队而言,大家都是在探索。会受到自己团队内部,包括投资人和商业化的一些的压力,就会选择一个垂类的场景。这时候客户给大家的要求的时候,就会导致跟你逊计谋的这个思路肯定会有背离。

01:12:21 1

所以你们是怎么看到他能做成通用的可能性的?

01:12:25 2

我觉得不是通过以前一系列的研究的工作,能够感知到这个系统应该可以 work。就是说在小规模上当中的话已经起作用了。只要在给整个搭建完整系统里面,大家再齐心协力去试一下的话,有可能能够得到初步的结论。

01:12:43 1

要做通用人工智能,它是一条更远更长的路。在这个中间怎么让自己的公司活下来?你作为公司的 CEO,你会有这个压力存在吗?

01:12:55 2

我觉得我们肯定会有压力,但相对而言还好一些。我觉得机器人在这波趋势里面,由于大模型的出现,包括英特尔的出现,我们感觉会把它推到下一个阶段。我们实际上是不会读某一个垂类场景能够跑出来。而是希望我们通过提供一个硬件加底层的模型让大家去试。

01:13:20 2

我们希望我们服务的 1000 个开发者里边,有 100 个能够找到能够小批量去做部署的这样的一个应用的场景。但另外 900 个人可能会有比较好的 demo 或者是研究的成果。这 100 个人里面可能会有五个十个会做一个超级应用。他可能会需要部署 1 万台甚至更多的机器人到不一样的场景里面去。但究竟是从冰箱里面去给我们取饮料瓶、倒水,还是说在工厂里面去完成汽车的组装,还是说比如像亚马逊这样的一个仓库和分拣环境里面去抓丝芙兰的唇膏。

01:13:55 2

我们不会去赌某一个场景。因为这个团队我觉得他的特质也并不是说到工厂里边去部署和集成测试。整个的这个开发者社区里边,包括集成商自动化团队,各自都会有各自不一样的擅长。我们希望就是做底层的新的工具链给大家。

01:14:13 1

现在把更多的钱投入到你们更有长远场景的研发上,还是说把一部分的精力也投入到比如说针对开发者的软硬件一体的平台的分发上。你觉得哪一个是你现在在负责的重心,或者说你会怎么去做你的。

01:14:33 2

资源的分配。我们的核心是在提供一个可靠稳定的硬件加底层模型。从一个抓的技能到 3 到 5 个比较常见的技能。并且把它的组合的开发的工具做好,让 100 个开发者能够在上面去做不一样的应用尝试。这是我们在现在和接下来几年时间最核心的一个目标。我们希望 100 个 1000 个开发者在上手,能够出现我刚才描述的情况。有些人可以找到一些有意思的应用场景,可以做批量的使用和部署。

01:15:08 1

也会支持你们技术团队去做大规模的研发上的投入。

01:15:12 2

我们肯定会在这方面是我们最核心的持续性的投入。但是为了验证大家可以拿它去做行业里面的垂类应用。我们肯定也会挑 1 到 2 个场景跟 1 到 2 个开发者紧密的配合,把我们的开发工具。

01:15:27 1

一定要做好。如果十年后回头来看,你是希望速度科技被人记住的是说我们做出了一个通用机器人的产品,还是说我们证明了 seem to real 这条路是对的。

01:15:40 2

我觉得 sim to roll 这条路是对的,是副产物。我们希望 10 年以后,当大家回看今天的这个时间节点的社会,认为这可能是一个类似于像 iphone 加 IOS 操作系统。那个时候会有新的 uber、滴滴、美团,会有新的 dash 长出来。我们希望大家用的硬件加底层的系统和软件,至少有一部分是我们提供的。

01:16:05 1

一个非常有野心的梦想。

01:16:07 2

对,的确是现在。

01:16:08 1

做通用应该要牺牲很多垂直的商业化机会。

01:16:12 2

我觉得是的。但我跟苏浩在一开始在商量的时候,我们也觉得现在如果是做垂类的商业应用,有的时候账是算不过来的。

01:16:22 1

但大家也在抢地盘,就是有些产品一个机器人部署了。

01:16:26 2

它很难再换一个。对一个机器人部署替代一定的人工。实际上你也可能要花 3 到 5 个 PHD 的一个成本去维护。

01:16:35 1

对,还是挺好的一条路径的。

01:16:37 2

对我觉得就是难,但是可能最终是最有效的方法。

01:16:42 1

好,今天非常精彩,谢谢。好了,这就是我们今天的节目,大家会怎么看机器人的这场竞赛呢?欢迎给我们写评论,写留言。

01:16:54 1

播客的听众可以通过小宇宙苹果播客还有 spotify 来收听订阅我们。大家也可以在 B 站和 youtube 上搜索硅谷 101 播客,来看到我们的视频版本。我们部分的文字稿也会收录在硅谷 101 的微信公众号上。我是红军,感谢大家的收听。

Click any line to jump · Hover to ask AI

Content Overview

对话探讨了特斯拉 Optimus、波士顿动力 Atlas 与 DeepMind 及亚马逊在机器人领域的布局,强调了通用性与垂直赛道的平衡及底层模型对开发者创新的促进作用。速度科技聚焦于全栈机器人技术,采用 Sim-to-Real 路径,通过高精度 3D 数据集和强化学习,实现机器人在开放环境下的稳定操作,目标是成为机器人领域的“安卓操作系统”,推动家庭、工厂和商业环境中的广泛应用,助力通用机器人愿景的实现。

#### Speaker Summaries

发言人1

介绍了硅谷 101 播客中对速度科技这家机器人的初创公司的深度访谈,强调了机器人技术评估的复杂性,尤其是环境适配对演示效果的影响。他指出,速度科技在未训练新环境中进行机器人演示的能力,以及联合创始人苏浩在 3D 数据集和机器人仿真领域的开创性贡献,是其核心竞争力。他深入探讨了从仿真到现实的技术路径,以及速度科技如何通过高质量的 3D 数据集和物理法则遵循的仿真器,实现机器人在开放世界中的操作。他还讨论了速度科技的商业模式,与硅谷其他机器人公司的区别,以及对机器人行业未来发展的看法,特别是通用性和垂直场景应用之间的平衡。最后,他强调了速度科技追求通用机器人技术的长远目标,以及在商业化压力下坚持技术探索的挑战。

发言人2

强调机器人操作物体的复杂度远超移动控制,提出上下分层架构可能重新成为主流,以更高效地实现商业化。其公司专注于全栈机器人技术,从大脑到本体自主研发,尤其重视基于仿真的训练方法(Sim-to-Real),以解决真实世界数据不足的问题。他们致力于构建结构化的 3D 物体数据集,提升机器人在开放环境中的操作能力。未来,公司计划通过提供稳定可靠的硬件与底层模型,支持开发者在不同场景下应用机器人技术,期望在十年内引领类似 iPhone+IOS 操作系统的新生态,促进新应用和行业的诞生。

机器人 速度科技 苏皓 韩铮 全栈 3D数据 ImageNet 动力学约束 开源数据集 仿真器 操作模型 灵巧手 人形机器人 物理关系 力的反馈 3D建模 数据集 精度 亚毫米级 物理环境

Content Overview

!Image 2

机器人已经能在舞台上做到翻跟头、表演武术了,但要让它在开放环境里伸手帮你拧开一个瓶盖,难度陡然跃升2到3个量级——因为那一刻,它需要理解眼前的物理世界。

这正是苏度科技想啃下的骨头。苏度科技联合创始人、董事长苏昊是ImageNet的核心作者之一,师从李飞飞,这家公司走了一条与硅谷主流纯大脑“黑盒”大模型不太一样的道路——软硬件协同设计,上下分层架构,上层负责任务规划与环境理解,下层用仿真(Sim-to-Real),让机器人在虚拟世界里经历几百万年的进化,再迁移到现实。

这条路已经跑出了一定成效:面对从未见过的新物体,他们的零样本通用抓取单次成功率接近100%。

本期硅谷101,我们邀请苏度科技CEO韩铮,一起聊聊机器人“动手”怎么实现?他预测,接下来会有更多的硅谷公司会重新回到“上下分层”的方向上来。 【主播】

泓君,硅谷101创始人,播客主理人 【嘉宾】

韩铮,苏度科技联合创始人&CEO 【你将听到】 机器人“动手”的数据根基 03:17 为什么做全栈(大脑+本体)通用机器人? 07:14 苏昊早年经历:从图片标注ImageNet,到3D数据集ShapeNet 11:08 3D数据收集,难在哪里? 13:21 仿真需要亚毫米级精度,视频训练无法达到 16:33 什么是Sim-to-Real(从仿真到现实)? 18:08 创业时机的判断:DALL-E带来的数据拐点 Sim2Real技术验证与关键突破 21:40 仿真器的技术内核:经典物理法则+强化学习 24:17 数据集质量与规模的平衡:自建结构化3D数据集 28:05 实际效果如何?零样本通用抓取,一次性成功率98% 32:11 回应Demo质疑:去学术会议现场随机环境中演示 34:22 基础Zero-Shot泛化能力比长程任务串联更为关键 3:45 灵巧手虽好,但不是当下的性价比最高的方法 技术路线之争 38:16 商业模式思考:硬件+底层模型+API,类比智能手机生态 41:23 仿真器与机器人本体,必须软硬件协同设计强绑定 44:04 如何教会机器人拧瓶盖?加入真实世界数据更高效 44:51 难度对比:操作物体比运动控制难2~3个数量级 47:28 白盒与黑盒之争:分层模型,在预训练中融入物理理解 51:11 Sapien仿真器,让机器人像幼童第一次拧瓶盖一样操作 53:27 数据冷启动困境:无法复刻特斯拉,必须靠仿真做冷启动 55:38 嘉宾预言:被硅谷抛弃的“上下分层”即将重回主流 全球机器人竞争格局 59:08 实现机器人动手,软硬件强结合的公司才能做到 01:00:34 硅谷明星公司点评:Skild、Figure、Optimus 01:05:40 为什么最看好DeepMind+波士顿动力Atlas的组合? 01:09:01 亚马逊机器人,场景多但整合困难 01:10:02 为什么多数公司退回垂类?因为不知道通用该怎么走 01:12:43 不做垂类押注,而是构建开发者生态,目标是成为机器人时代的“iOS+硬件” 【延伸阅读】

节目中提到的Demo:sudo R1评测——60分钟连续无剪辑实测 【硅谷101正在招聘】

《硅谷101》招聘多个全职岗位,欢迎加入我们的超酷的深度内容工作团队!

👉🏻点击查看招聘详情

!Image 3 【监制】

泓君 【后期】

Amei 【运营】

朱婕 【BGM】

Particle Emission - Silver Maple

My Moon and Your Sun - Hampus Naeselius

On the March - Brendon Moeller

Quietly Tense - Marten Moses 【在这里找到我们】

公众号:硅谷101

收听渠道:Apple Podcast|Spotify|小宇宙|喜马拉雅|蜻蜓FM|荔枝FM|网易云音乐|QQ音乐

其他平台:YouTube|Bilibili 搜索「硅谷101播客」

联系我们:podcast@sv101.net

Special Guest: 韩铮.

Make your daily reading actually fit you.A daily brief built from the sources you follow. Get started free

00:00 / 00:00

查看原文 → 發佈: 2026-07-16 08:00:00 收錄: 2026-07-16 12:00:53

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。