← 回總覽

146. 对 Physical Intelligence 柯丽一鸣 4 小时访谈:Pi 的开源模型研究,机器人的江湖、族谱与主角

📅 2026-07-16 08:30 张小珺 人工智能 74 分鐘 92437 字 評分: 91
具身智能 机器人 强化学习 Physical Intelligence AI Agent
📌 一句话摘要 Physical Intelligence 研究员柯丽一鸣深度拆解机器人大脑的研发历程、全球机器人学术与产业江湖,并探讨 AI 与人类未来的共生关系。 📝 详细摘要 本期是对硅谷明星机器人公司 Physical Intelligence(Pi)研究员柯丽一鸣的深度访谈。作为 Pi 核心论文作者,一鸣系统梳理了机器人领域从传统路径规划到数据驱动范式的百年变迁,并首次将全球机器人团队划分为「学术族谱派」与「机器学习派」两股势力。访谈核心聚焦 Pi 的开源模型研究路线图:从注重「能力」的 π0,到追求「泛化」的 π0.5,再到关注「表现」的 π*0.6,并独家补充了尚处保密阶段的

PODCAST

91⭐ Featured

Physical Intelligence researcher Ke Li Yiming deeply dissects the development journey of the robot brain, the global robot academic and industrial landscape, and explores the symbiotic relationship between AI and humanity's future.

!Image 1: 146. A 4-hour Interview with Physical Intelligence's Ke Li Yiming: Pi's Open-Source Model Research, the Robot World's Landscape, Genealogy, and Main Players

00:00 00:00

00:02 1

Hello, 大家好,我是小俊。今天我们的嘉宾是硅谷机器人公司 physical intelligence 派的研究员柯隶移民。他也是一家专注于研究机器人大脑的明星。创业公司成立仅两年,投后估值已经超过了 50 亿美元,是这个赛道最受瞩目的独角兽之一部分。业界人士对他的期望是成为机器人领域的 OpenAI。科林一鸣在派主要负责强化学习方向的研究,也是派的核心论文的作者之一。在科研之余,他也追求在工作和人文表达之间找到平衡,所以业余时间他也会写写小说,这让今天的聊天变得更有意思了。

00:47 1

在节目中我们详细的聊了聊机器人的江湖谱系,门派与主角们。全球的机器人团队都非常关注派在机器人大脑上的开源工作,一鸣也详细的阐述了他们的研究思路与技术细节,从派 0 到派 0.5 再到派 0.6 星。但由于我们这期节目的录制时间相对比较早,所以尚且还没有囊括进他们的最新模型。派 0.7 嘉宾关于这个工作的技术讲解,我会补充在 show note 里。接下来就是我对科里移民的访谈,期待 2026 年我们和 AI 共同进步。

01:30 2

确实我们不做人形,因为他们要说做人形我就不来了,你知道吧?我其实一直很想做的就是机器人可以造自己,我觉得这个是机器人发展的一个可能会是一个里程碑。因为它就像一个种族,是有延续性的,是可以通过自我的一种繁殖。我觉得机器人能够组装造自己就是一种繁殖的体现。

01:49 2

第一篇是派灵,它的关键词应该就是能力。第二篇是派 0.5,它的关键词是泛化。然后最近的这篇是派 0.6 星,它的关键词是啊表现。

02:01 1

你们公司其他人会很关注中国机器人的发展吗?

02:05 2

我觉得都很关注,这是一个不可忽视的一个部分。

02:11 1

我们今天的嘉宾是硅谷机器人公司 physical intelligence 派的研究员 K 科里一鸣。然后 physical intelligence 是一家在硅谷机器人大脑的探索上非常有名的一家公司。不过前两天我跟 K 聊天,发现他除了是一个 researcher 之外,他业余也是一个网文写手。那 K 你要不先来自己介绍一下自己?

02:33 2

大家好,我是科利一名平时朋友都叫我 K 我每天平时的工作是教机器人能够更快更好的去完成任务。然后业余的时间我是非常喜欢人文、艺术这些东西。写小说也是一种可能表达这种情绪的方法。很高兴今天能有这样一个机会,梳理一下自己在研究中的想法和大家分享。

02:58 1

你觉得做机器人和写小说有什么共通之处?

03:03 2

我觉得都是有一些创造力的需求的。比如说这个机器人,它现在完成很多任务还不够好,你需要想一些新的方法。而且小说可能你真正想写的那个故事还没有被写出来,你也是需要把它创造出来,很多时候需要一些比较天马行空这样的想法。另外也是有一种执行力。像我在做研究过程中,其实经常是有了一个想法以后,慢慢的把这个想法落地。中间需要一些工程这样的写代码这样的事情。而且小说有的时候是有了一个命题,就为了让读者感受到这个命题,开始一个字儿一个字儿的在那里骂。

03:44 1

我很好奇,你平时写什么小说?然后你在小说里有藏着一个跟硅谷机器人公司内部的叙事不一样的一个世界观吗?

03:54 2

平时写的比较多的是科幻小说,这个也是我最爱读的小说分类之一。科幻小说的话我觉得肯定是和我们现在生活的这个硅谷,现在所处这个时代有一些关系。因为我在科幻小说中比较痴迷的一些类型都会涉及到两个命题。第一个是生产力变化以后,人们的生活是怎么改变的。第二个命题是在和我们的社会风貌很不一样的这种未来科幻的社会里面,人与人之间的关系是怎么样的。因为我觉得在第一个命题上面,可能和我的工作会更相关一些。工作时候就经常会考虑到我们做这些人工智能的研究,做这个机器人是一种自动化。如果你能够把很多现在人做的事情给自动化的提升一下效率以后,人去做什么样的事情是一个其实每天都会想的一个命题。

04:54 2

第二种可能是我因为我觉得人与人之间的关系是一个自古有永恒不变的话题。在写小说过程中,你可能也会去读别人的小说,也会和几千年前的这些生活在不同世界的人,他们的一些思想产生共鸣。我觉得应该是有一些人性之类的东西,其实是在生产力大幅度变化的未来科技社会也会流传下去。

05:19 1

所以在 AI 这个时代,在机器人马上就要进入我们的生活的这个时代,你觉得人会发生什么变化?人和人之间的关系会发生什么变化?而且现在不是人和人之间关系,还有人和机器人之间的关系会发生什么变化?

05:33 2

我觉得这是一个正在梳理中,还没有一个很确切的结论的话题。因为一谈到人和人的关系,我是一个相对而言比较内向的人。你可以从每一个人不同的研究风格中稍微感受到一些。我觉得我的研究风格的话,很多时候是我先想把自己埋在一个洞穴里面,先埋头苦思一会儿。但是为了不要变成一个闭门造车的人,你肯定还是要把头从这个里拿出来,然后去到这样的场合和别人去交流,去碰撞一下思想。然后接下来真的定下来一个命题以后去执行这个执行我一直觉得以前的话我在 PHD 期间读博期间是一个比较独狼的一个玩家,就是牛郎玩家。你想要去实现,那就说干就干呗。中间遇到了什么问题,我们可以自己去上网去探索,去学习,我们可以通过提升自己的技能,组织一个比较小的队伍去解决这个问题。

06:31 2

而从读博毕业以后,加入到了这么一家初创公司,做机器人的具身智能的大脑。一个比较深切的感受就是有一些事情是得在一个团队的协作中才能完成。之前读博的一种项目,可能它的这个规模是比较小的,要解决的问题也是比较具体的。而现在为了要做成这个通用的大脑,你是需要团队中每个人都在自己比较擅长的事情上发挥作用,所以是一种为了完成一个任务,要大家齐心协力。

07:03 2

这中间的很多人与人之间的关系联系会比我之前的那种可能要紧密一些。同时我在想就是如果生产力变化以后,因为最近硅谷不是有很多这种 cloud code,可以自动帮你编程的这种小工具。人与人之间的这个关系好像又可以不用那么紧密了。因为有的时候我与其是去问我现在要做的这个项目需要用到某一个模块,这个模块的负责人我就直接跟他说一下我们这个是怎么回事,问下来可不可行。我干嘛不直接问这个 cloud code 呢?我可以通过和这个 AI 的一个智能体的交流,把以前我需要和人交流的这个方面给它拿掉了,就是减少了我对这个的依赖。甚至包括我们现在很多自己的工作流程,也是一个人掌控着三四个 agent,然后让 agent 去干很多活。这个有一些改变了团队协作的中间人与人之间的关系。

08:03 1

所以你在跟人沟通之前会先去找 close code.

08:07 2

没错。

08:08 1

然后就扣成了人和人中间的那那个环节没错。

08:12 2

我觉得这个关系就是有我在构思一些小说的时候,是会受到这个关系的启发。比如说一个是想法是说现在在一个比较信息爆炸的时代,我觉得现在可能已经有人是这样的信息爆炸的时代。以后以前你的很多信息都是我一个人去浏览一个浩如烟海的互联网信息。但是有没有可能就是我有一个小 boat,就他可以把互联网上所有的这些信息就看得比我快,看的比我多,然后又了解我的喜好以后,全部揉碎了给我吃,给我再喂给我。同时如果以后真的大家都变成了默认的模式,就是由你的 bot 去爬这个信息,去分解这个信息的话。可能以后没有这个 bot 你就很难在浩如烟海的互联网里面生存了。因为你这个人能够看到信息就变得非常的有限。

09:00 2

然后另外一种可能是我觉得生产力的进步。我这个人因为之前是独狼玩家,所以会就畅想一些非常适合独狼玩家的一些生存方式。比如说像田园牧歌,就一个人的这种乡村生活,大家会在 youtube 上也会看一看这样的类似的博主。我会畅想一下说,我将来就到了一个远离人烟的地方去生活。然后这种生活现在的话叫我我我肯定不敢去,我会觉得要干好多事情,要脱离这个现代社会的这种基建的支持,去干这么多事情。一个人对我我能做到这些事情吗?我这个烧水、弄饭这些可能现在还有一些基建,但是就家里这些家务,还有各种各样就是我不想干的事情,我怎么能够在远离人间的方式下把它干出来?会想到我们现在正在做机器人比较近期一些的应用,可能就是说能够把我不想做的事情给他做掉。

09:56 2

但是以后更多的畅想是说,如果真的有一天机器人的这个技术能够飞速发展的话,可能你现在需要拜托很多人。比如说修水管,这是一个爱美国社会永恒的难题。修水管你现在是需要依赖人的,但将来有可能是机器人来解决。甚至包括你现在做的很多项目,就是随着这个智能体的发展,以前可能是需要你拉一个人的团队,以后可不可能是拉一个人工智能或者机器人的团队。

10:22 2

甚至就是像现在的我们去看很多 1000 年前的原始社会,可能会觉得他们生产力、制造力没有那么发达。如果我们在 1000 年后再看的话,说不定他们看我们也是原始社会。他们那个时候每一个人能够拥有的这个生产力,都相当于现在每一个国家能够拥有的生产力。我觉得这个可能独狼玩家会挺快乐的。

10:45 1

人和人的关系会变得更加的松散。

10:48 2

我觉得是可以让人和人的之间的关系变得更加松散。可能在原始社会,一个人在广袤的大自然里面独自去狩猎生存的话是比较难。而现在的话找一个地方埋起来,好像把自己头埋起来,好像没有那么大的问题。但将来也许可能在宇宙中你可以探索,你说不定可以发现了一个小星球,你就直接在这个星球上面定居,你就可以搞很多机器人来帮你在这个荒芜人烟的星球上面搞好基建。你可以建很多你想建的,你想建高楼大厦,你想造这个内外都可以成功。

11:22 1

我觉得还蛮有意思的。所以脱离一切的外部的条件限制,你自己是希望能够回到洞穴里去的,是吗?

11:30 2

为什么呢?我觉得并不是完全是说彻底的活在洞穴之中,但是人对于自己的这个空间是会有一些追求的。作为一个内向的人我觉得我的回复能量的方式其实是一个人静静。然后在一个硅谷这么一个非常喧嚣,非常无时无刻都有新的讯息涌入的一个环境里面,能够找一个空间去自己静静,其实比我以前的这种生活是有一些难度的。所以可能对找一个洞穴稍微待一阵子产生了一些向往。但我也认为人还是社会性动物。在洞穴里待久了,可能像我这样的人也会想要走出来再看一看。

12:15 1

说这个还挺有意思。我记得有一个老师,他说他对于他下一代的小孩儿不跟人谈恋爱了,只跟机器人谈恋爱。一点惊讶都没有,现在你能接受这个事情吗?

12:28 2

我觉得我还挺能接受的,因为我是老二次元了。我的生活中是有不少这样的朋友,他们的生活方式可能和老一辈的那种观念是很不一样。但是因为他们一起熟了熟悉了很久的朋友,我甚至能够理解他们做的这些不想和人类谈恋爱的选择,或者他们自己在社交方面的一些偏好,以及包括大家对纸片人二次元的这种造物的喜爱。包括我自己也是有从有有参与一些这种二次元的同好活动的。

13:02 1

哪些文学作品、影视作品或者各种各样的文艺作品有对你对机器人的思考有过帮助和影响吗?

13:11 2

我觉得一时半会儿很难指出哪一个具体的作品,但我们也许在谈话过程中会触及一些别的,我都可以分享。但是我觉得现在有一些或者说之前看到的一小类的文学作品中描绘的这种人工智能的毁灭世界的这个命题,让我觉得有一些从现在的角度,以我有限的视角来看,会觉得不太可能。真的会走到这一步,所以会有一些反思,就是我们真的会开发出一个智能体,然后不知道怎么的,它的可能诞生的使命是帮助人类,但最后他存在的客观意义上却变成了与人类变成了一个对立的关系。我觉得现在的我是很难想的,但是因为一直没有想通为什么这个逻辑是成立的。

14:01 1

所以一直都在想为什么这个逻辑不成立呢?

14:05 2

我觉得以现在的就是 2026 年我们弄一个快照,看看现在的状况的话,我会觉得现在智能体干的最坏的事情是什么?我知道好像前几天有一个什么人把很多的权限给了一个智能体,让他帮自己清邮箱。结果这个智能体得到了这个权限以后,就把他的邮箱全都删了,删的快差不多了。它的命题就是给这个智能体的任务是得到了执行,但智能体的执行并没有和他真正想要的这个任务重合,我觉得这个问题是确实存在,但现在智能体得到的权限,承担的责任以及他能做的事儿都比较有限。

14:47 2

得到权限的话,很多时候大家都是会 prompt,你现在不清楚的话,你先别慌着动,先跟人确认一下。然后,他承担的责任,比如说我之前其实有去受伤,受伤的过程中我就是到处求医问药。但美国这个社会的医疗是有一些难的。这个时候我就会把我的一些医疗资讯发给这个智能体去让他给我解答。但是其实在这个解答过程中,我也不会真的就彻底的相信说我也不可能说这个 AI 跟我说什么我就信什么,对吧?我肯定还是要把它带到一个人类专家的面前去跟他确认。因为我不觉得如果我真的基于他的这个推荐做了一个什么事儿的话,他是能够承担责任的。就承担责任这个方面,我觉得现在他承担的责任还非常有限。

15:31 2

而在这种人类社会里面,就是谁能够承担责任才会建立一个信任。我觉得这种信任还是在演化的过程中还没有到。我们就完全相信一个智能体给他那么多的权限,然后最后是他现在能做的事情,我觉得也比较有限。比如说我们机器人,我们有的时候行业内部笑话,这个笑话可能已经有一些过时了。这是大概三四年前和一个快要毕业的同学在聊天,我们就在吐槽说,我们这都这每天都在做什么呢?就是让这一个机器人把一个红色的方块放到一个蓝色的方块上,这不是三岁小孩都会做的事情吗?我们天天就在这儿花了五年时间读了一个博士,然后教机器人做做的可能也许或者还没有三岁小孩好,还不如生个娃。人类的学习速度是非常快,所以我觉得这三点因素导致了在我看现在的智能体,我是不太相信他能够在现在这种节点上做到跟人类的。

16:30 1

对立面这种,因为写小说和写网文,其实都要从现实世界有很多的取材,很多是取材于生活。是我没有看过你的小说,因为你不告诉我你的网名。但是我很好奇你会把你的派的工作经历的哪一个部分作为素材提取出来,放到虚构的作品里去。

16:50 2

我其实是一个工作和生活分的相当开的一个人,我觉得在拍的工作经历肯定是影响了我的思考。比如说你对技术发展到哪一步了,以及技术发展中的一些 cokey。比如说比较特殊的一些东西,会有更多的一些思考,就是比较具体的思考。而我的网文很多时候就天马行空,在网上保护好自己的身份,以后想写啥就写啥,不是挺好的吗?

17:18 1

所以你能告诉我们的网名是什么?

17:21 2

不是救命,马甲保护好。

17:24 1

那我们接下来。

17:26 2

聊聊。

17:26 1

你的成长。好,因为我发现很多硅谷的人都是从小受益于竞赛的一群人是的。

17:35 2

我感觉。

17:35 1

这个还挺多见的。那么讲讲你的成长经历,你是通过竞赛改变命运的人吗?你能算这个类别吗?

17:44 2

我觉得是,而且当我在成长的过程中有一些感触,但甚至都没有现在的感触那么的深。我觉得我人生中是有一些关键的节点,或多或少都受到了我搞信息学竞在这个影响。其实我小时候出生在安徽省,然后上学是在安徽省的芜湖市。这是一个可能,互联网上大家了解它都是因为芜湖起飞这么一个网络用语,但它其实是一个城市。而这个城市它就客观来说的话,它的教育资源什么的,可能和大城市,比如说上海这样地方还是有一些差距。

18:22 2

但是非常凑巧的是,我们这个城市有一个很优秀的信息学的一个竞赛老师。他当时是在我们城市那边做学生的时候,因为一些事故受了伤,然后失去了双手。所以这一个遭遇让他最后在就业的时候可能影响到了他,让他选择回到这个家乡去当了一个计算机老师。但是因为他这个人非常的聪明和优秀,所以他在这个投身计算机教育的过程中,就是他出力。他是江涛老师,我甚至跟他都没有真正的面对面的交流过。但是我觉得我是有从他的很多这种贡献中受益的。

19:09 2

就是他在我们那个城市开设了比较系统的竞赛的这种七次皮培养什么意思呢?就是像我们小时候会上那种奥数班,在我们那个城市其实是非常正规的,有信息学奥 3 班的,他就是个兴趣班。你家小宝宝几岁了?我是八岁去学的这个东西。

19:27 2

当时我们小孩子也没有想太多,只是觉得可以玩电脑了,太高兴了。只要不要我去学一些正儿八经的东西,让我去玩一些不那么正儿八经东西,我都是非常高兴的。所以在这个过程中就无意之中打下了一些后来编程的基础,并且一步一步的去走上了竞赛的道路。然后在成长过程中,我也是探索过其他的职业发展的。比如说我大学其实学的是心理学,最后又转成了经济学。你大学本科。

19:57 1

是其心理学,我是心理学开始的。

20:00 2

对我的大一因为美国大学它是可以换专业的。我的大一的选择的专业其实是心理学。在学过了一些心理学以后,感觉到了第一学的东西非常有趣,第二我实在是不太适合做心理学。为什么?我觉得有时候人是有一些打破砂锅问到底的这种性格在我身上。如果在学心理学的过程中,就会有一种这个玩意儿。他说的非常的有道理。但是如果我想打破砂锅问到底的话,我也许可以做。但是要很多年以后,或者说做一些别的事情不够直接。可能我们对于解决问题,解决一个非常具体的问题是有一种痴迷的。

20:39 2

所以当时又去学了经济学,就是想要了解一下自己生活的这个世界。但是最后转回了计算机,还是那个原因,就是觉得这个能够帮助我了解这个世界,但不能帮助我了解我在这个世界中想做些什么事情。所以最后还是转回了一个相对而言更理工科的计算机的道路。所以你整个。

21:00 1

大学经历了两次换专业。

21:02 2

对然后在这个成长的过程中能够探索其他的行业,再回到计算机,我觉得真的是因为非常的感激。小时候有这些竞赛的。

21:16 1

这个辅助,竞赛对你性格影响大吗?

21:20 2

其实不是很大,因为我搞竞赛的时候还是那种比较悠闲的。因为小时候对我来说只是一个兴趣爱好而已,我们就是觉得这个东西好好玩。因为刚开始学的时候是学 logo 语言,它不是像现在这样都是打文字,它是一个图形的一个界面。作为一个小学生看到这么一个计算机,它可以画画,然后你就让他画各种各样好好玩的画,当时就觉得非常的高兴。所以在竞赛的过程中,我对于计算机编程的体感一直是非常快乐的。

21:49 2

当时还有一本教材是中学生学 C 语言。其实我这可能是我这辈子唯一就认真读完的编程教材。后来的话都是网上现学现卖。因为在读这个教材过程中,作为一个小孩子,他接触编程,我觉得真的是有一种思维会不太一样。他会用讲故事方法教你很多编程的原理,比如说递归,就是跟灯神去许愿,然后许了一个以后让他再给你三个愿望。我说这些东西都非常的自然而然的就能够融入到我的生活之中,把它有一些内化了。所以在这个层面上就是搞竞赛或者说很早的去学习编程这件事情对我的思维有一些影响,但可能是比较润物细无声的,我并没有感觉到他对我的这种性格造成了一些。就是非常明显。

22:32 1

非常突然的那种变化。你小时候是一个很乖的小孩还是一个叛逆的小孩?

22:37 2

是一个看起来很乖但实际上很叛逆的小孩,有多叛逆?我就记得我我小时候上小学的时候,第一天我爸妈不知道怎么想的,给我剪了一个板寸头。然后当时你知道小学生的话,你去一个小女生,然后留着一个板寸头,然后大家就会笑话你我就记我就记得上小学的第一天,我是哭着上学的,因为被大家嘲笑而内心无法忍受,就是不知道该怎么处理这种事情就哭了。可能是我小学哭得最惨的一次。然后当我小学毕业的时候,已经变成了学校里的大姐大。有什么想法我们可以坐下来的做个聊聊,不行的话就把你打服。是当然就是使用暴力不是一个很很好的事情。只是在小学那个环境下,我感觉我你能明显看到我的一些性格上有一些一个不太符的这种方面。

23:26 1

你是怎么在小学那个环境里面,从一个第一天。

23:30 2

哭鼻子小女孩。

23:31 1

变成一个大姐大的?我知道别人都叫你柯姐。

23:34 2

对吧?对,就是我朋友对我的称呼,从小学一直到高中都是这样。我觉得可能就是个人动手。

23:42 1

我觉得性格上。

23:44 2

有一些路见不平一声吼的这种因素在里面,会有一些对公平、正义这种事情的一种追求。然后也会去在小学时候也会去想办法完成这种事情。比如说小学的时候会看到有一些人在欺负别的人我就会说你在干嘛?你不行,我们就来打一打,你这样不行,就会会去达到一种心中的一种正义的状态。

24:11 1

在你心中有什么是别人觉得可以接受,但你觉得是触发了你对这个世界不公平、不正义的感知,然后你要反抗的。

24:22 2

我觉得生活中确实没有那么多事情是绝对的公平,甚至公平的定义都很模糊。可能不同人有不同的想法,我只是一个尽量在自己的力所能及的范围内维持一种公平。有的时候我觉得每个人也没有什么权利去要求另外一个人一定要按照他的想法去做。但是在这层之上有什么东西是我觉得他还是比较有普世价值的,可以这么去想的。

24:57 2

我觉得一方面是一方面可能是我觉得有些心痛,就是教育资源这个方面。当我出了国以后会有一些感慨,就是我在国内受教育的这段过程中,其实是曾经觉得我想上一下清华北大这样的学校,会想去考。但是因为我在安徽省,其实安徽省的话是每一万个人里面可能有三个人,四个人能够上到清华北大。我觉得我当时上的是竞赛班,在高中,然后也是从传统的升学道路里面一步一步学出来的。我也不是一个特别优秀的那种,优秀到骨子里,真的非常热爱学习,花很多时间去学习的。我就是一个竞赛班里面中等,我喜欢的事情就多学,不喜欢的事情就少学的那种学生。所以我知道我可能就除非我转了性,然后特别用功,才有可能拼一拼这个 1 万个人里面的三四个人。

25:53 2

而当我出来以后会发现其他一些的省份,可能确实有一些教育资源上的优是吧?比如说在大城市的话,可能会有 1 万个人里面有 80 个人都能上清华北大。这种数字在安徽是想都不敢想的,会觉得是有一些资源分配上的事情。但是可能在现在这个时间点上,更多的能够想的是如何通过创造更新的生产力,来在某个层面上抹平这些公平。

26:25 1

所以你觉得。

26:27 2

你不是这种。

26:28 1

激烈教育的优胜者。

26:31 2

我对我的同班,尤其是初中高中的这些同班同学终于报以崇高的敬意。我实在是没有办法像他们这样的卷,因为我们是竞赛班,竞赛班上的大家我觉得都非常的努力,都非常的知道自己想要什么。不像我这种从小就有点儿,虽然看着很乖,我是不会做一些特别坏的事情,但是我也没有那么的乖。学习这个东西,我就学我自己想学的就好了。所以在这种环境下,我觉得抱着这样心态,确实是没有办法和这种特别优秀和专注的同学们相比。

27:05 1

你小时候做最叛逆的一件事情是什么?

27:08 2

最叛逆的事情?我觉得因为做了叛逆事情太多了,你是很难评出。

27:13 1

一个最叛逆的事情。前三。

27:15 2

前三名。其实我我到高中的时候又把我的头发剪成了板寸。因为当时就非常想去东南亚去旅行看一看,然后觉得自己一个人在东南亚可能不太安全,就把头发剪成了板寸,然后整个人打扮的就是一个非常男孩子的样子。这样走在大街上可能大家也会该怎么说呢?就是去可以这么总结,可能是在东南亚背包的这段经历相对而言是比较叛逆的。因为它是一个没有明显的目的,也没有明显的目标,也不知道他对我的人生有什么影响,但是就是非常的想做。但其实还比较幸运的是,家里人也没有那么的强烈的反对,他们只是觉得好奇怪,怎么做这个事情,你保护好自己的安全,然后每天就是不停的骚扰我说就赶紧劝回来。

28:02 1

劝回来不要再搞这些奇怪的事情。

28:05 2

您是高几去的?东南亚?大概就是高二底就当时其实已经想着要不要出国了。因为之前是在走升学的这种高中,所以没有知道自己是要出国的,就差不多是一个很快的一个思想上的转变,然后目标上的转变。然后稍微去执行了半年,然后突然就发现自己还是有点闲的时间。当时就想说要做点什么,就去了东南亚背包。因为之前非常的喜欢有几本印度的神话相关的小说,开始迷上了印度的宗教的建筑,就想跑过去看一看。

28:35 1

去了多久?

28:36 2

去了大概两个。

28:37 1

星期一个人去的吗?

28:39 2

对我一开始,但是我后面我爸爸妈妈也来找我了,他们可能还是有点不太放心。

28:45 1

所以你是为了去东南亚,所以把头发剪成板寸,为了自己安全。

28:49 2

我觉得这个是。但是其实头发剪成板寸非常的方便。因为我之前在在我成长的这个初中高中的这个过程中,我的朋友们其实都知道我是一个非常不修边幅的人。什么头发打理、梳头发这个衣服的扣子,就是我到班上上学,到班上以后,班上有一些跟我关系比较好的女同学就会来帮我稍微打理一下仪表,因为实在是看不下去了。

29:11 1

我在想你去东南亚把头发剪成板寸,是不是潜在内心是有一种。

29:18 2

不安全感的?很难描述。但是因为会不自觉的认为,如果可以像一个像一个外表像男生的话,大家可能就没有那么多的不好的想法,就可以提前保护自己这样的想法。

29:34 1

你觉得这种不安全感它可能来自于哪里呢?

29:38 2

我觉得社会中的认知就是新闻,或者说很多听到的事情会让大家作为一个女生觉得自己处境会有一点点处在被可更可能受到侵害的这个位置上。所以就会想我要花更多的心思去思考怎么保护自己。我觉得你的选择很有意思。

30:05 1

因为有的人我觉得不安全,那我就不去就好了。那我就是安全的,我就在家里。

30:11 2

那还是要去的。自己想干的事情得找个方法把它实现。

30:15 1

你的方法是我把我自己掩饰成男生,然后我就安全了。

30:20 2

我觉得这是方法中的一种,可能是当时的我觉得最轻松方便又好用的方法。

30:26 1

你是怎么突然决定要出国留学的?你刚才也说你之前其实也是想着要考大学,突然转变了轨道。对。

30:36 2

这个我觉得就是人生中的冥冥之中的一个很小的决定。因为当时在高中看来是有三条路,第一条路就是升学。但是刚才也说了,就是在我的同班同学面前,我觉得自己就是一个渣渣,就是一种不上不下。叫我在再再花一点心思去提升自己的成绩。对不起,我真的做不到。就是我我没有办法做不相信不认同的事情。而学校的很多事情里面有一部分我是真的,我不知道我为什么要干这个事情,所以我提不起劲儿,提不起,因为我就学不好。

31:09 2

比如说当时我就学了一些,可能我比较喜欢像数数学、物理这样的学科,我就觉得我还是能够享受这个学习的过程。剩下有一些像生物和化学,我相对而言就弱一点,要背,对,然后当时成绩就怎么都上不去,然后学校的老师或者同学或者家长也会劝你说,好好加油,把这个短板给补了,你还可以冲一冲。我就想说我为什么要加油?为什么要补这个短板?为什么要冲一冲?我不干了不行,我不认同这个事情。所以当时有这个思考在的话,我就很难通过升学这个路去上到像清华北大这样好的学校。

31:50 2

然后还有一个契机是当时因为非常喜欢打游戏,就是非常叛逆。人家在升学高中好好学习,我在升学高中天天就是看小时候打游戏,然后偶尔接触到了一个叫雨雪的游戏。当时打的时候每个人都有中二的年纪,当时打的时候惊为天人,觉得我超喜欢古龙的小说。这个游戏非常完美的诠释了古龙小说的一种互动式应该是怎么样的。所以当时就非常崇拜这个雨雪的创始人,so fan e 然后当时因为崇拜他,所以又去了解了一下他的生平,发现他是他好像是清华大学的。我说这是第一次我在一个比较叛逆的道路上走着走着发现。人家是正规科班出身的一个大神,我就那看来上清华北大还是非常的有吸引力的。但是因为自己的这个水平可能不太能够上去,然后当时就想到走竞赛保送这条路,但是因为竞赛保送,当时保送的话是去中科大这样的地方。

32:46 2

中科大在我爸妈看来是非常好一个好大学,并且离家特别近,在我看来是非常不好。因为它是一个好大学,但离家非常近,所以就不能离家近,不能离家近,所以就想着说想要去一些更远的地方。然后刚好当时了解到是雨雪的创始人,他去了耶鲁去留学。

33:04 2

我就想说我也可以去留学,然后就跟家里人商量,然后就这么很偶然的就突然一下在高二的中间点转变成了要不咱们去留学,因为我是一个古龙的粉丝,所以他就是一种想象中的一种社会的一种剪影。而且因为这个剪影非常的纯粹,它有很多人的爱恨情仇都定格在最浓的那一瞬间。所以在游玩这个故事场景的时候,会得到一种非常大的心理满足。

33:35 1

这种游戏的受众会是男孩儿,这是我的偏见是吗?

33:40 2

我不知道该不该叫他偏见,我觉得也许是也许你把这个统计学揉碎了来看,说不定他的更多的玩家确实是男玩家。但可能在我心里并没有这种天生的,这个游戏就该是什么性别的人去玩这种想法。

33:57 1

他击中你的是什么?

33:59 2

这个游戏我觉得它糅合了几个我非常感兴趣的元素。第一个是他的美术风格,我觉得人是生来体验的,我觉得这是我对人文的这些着迷的一个很重要的点。就是你是来体验很多不同的东西。它能够通过这个场景的设置,以色调和这些非常阴郁的,和你现在生活完全不一样的一个世界,快速的把你拉到一个完全不同的一种可能性中。我觉得这个是非常吸引人的,人可能就寻求很多人会寻求不同的体验,有些人喜欢做这个事,做那个事儿。

34:34 2

我觉得游戏是其中的一种非常快捷方便的把你拉到平行世界。你可以在游戏里面当一个小卖部卖家。这不是之前那个什么分手厨房,你还可以在游戏里进行餐馆,你可以体验很多不同的人生。所以我觉得这个是 capture 的一种,如果我去成为一个武侠是什么感觉?

34:50 2

然后另外的话是他的这个,谁不是中二呢?就当时这种台词就觉得好酷。这个台词就是记得吗?不太记得清了,但我记有也许有一些东西太羞耻了,已经忘记了。但是对这种对这种非常纯粹的情绪的碰撞令我非常着迷。就是有一种你背负着血海深仇。你说我们在现代社会,你怎么会背负一个大部分人怎么会背负一个血海深仇?这个就可以在游戏里体验。当时因为对喜欢这个游戏不自觉的去靠近,可能潜意识里也有想过,将来有一天如果我能够创作一个自己的内容会非常的开心。看看别人这些已经创作是我非常喜欢的内容的人,之前的路径是怎么走的,我们也可以向他靠近一点。

35:38 1

所以你没有想过一个科学家的成长路径是怎么发展,你也没有想过一个企业家的成长路径是怎么发展的。在构思的是原来这个游戏制作人的成长路径是怎么。

35:47 2

发展的那你为什么没有去做游戏呢?我觉得写小说是我创造的一种宣泄的方式。而做现在这一行,人工智能做研发,可能是对我这个人追求效率的一种体现。就是我骨子里你看在大学中换的这些专业,其实我觉得这些专业都非常的有助于写小说内容。只是最后自己发现自己真正想做的这种工作的成就感,有很大一部分来源于就是我把一个别人做不到的事情做到了,或者说别人做这个事情我做得更好。这种思维不好说是不是因为在国内这种教育体系下,有一种还是有点竞争那种思维在里面,但确实是能从这种想把事情做得更好这件事里面得到回报。

36:33 1

你到了美国以后又发生什么变化?你有经历过文化冲击没有我觉得。

36:39 2

有非常大的文化冲。

36:40 1

你的性格有发生怎么样的塑造?

36:43 2

我觉得有两点。第一是在之前生活的环境来看比较的稳定,所以对周边的社会的人与人之间的关系是太稳定了以后,你其实感觉不到它的存在。就是你是出了国以后,开始接收到了一个完全不同的社会关系,需要找你这个人在这个社会中的定位,就开始重新思索。我以前好像不用做这个事情,我现在要做就是我不太清楚个人说话的时候,他有什么含义?因为以前你已经在那个社会里生活了很久,你就非常的自然而然。而现在到了一个完全全新的环境,不自觉的去调整,并且也使得你能够稍微客观一些的审视之前所处的社会环境和你这个性格。我觉得我对我性格的自我的认知,很多时候是到了不同的环境冲击下才得以显现的。

37:30 2

然后另外一部分是因为美国社会还是一个比较注重这个 presentation,就是你如何去表达自己。我觉得核心一点可能是说,他们最终是想把这些孩子培养成一个有领导力的一些人。就是他可以通过阐述他的梦想,来号召很多人去和他一起完成梦想。这和创业者这种企业家精神是有一些不谋而合的。在我那个上的大学里面是有很多这样相关的活动,还有包括课程里面的设置,都是在鼓励这件事情发生。

37:58 2

而我当时作为一个非常内向的人,乍一到了这个环境以后,就有一种就没办法,只能多说点话了,要不然的话真的不知道自己在干什么。不就是经过这样的一个环境所设置的这种关卡的走动,开始真的变成比较能跟别人说话的类型。如果你和高中的我说话,可能会发现我这个人就不爱说话。但是你和现在的我交流,我觉得我是在交流这方面。

38:26 1

有了很大的提升。你有觉得两个社会的文化的基础有什么不一样吗?你刚才还觉得在之前的成长环境里,你能感受到很多的不公平。那你到了美国之后。

38:40 2

不公平依然存在。只不过我觉得中国社会之前经过非常高速的发展。因为我后来还去英国留学了,所以把中国、美国、英国放在一个轴上面来看的话,会得到一个非常有意思的一个感觉。就是中国社会咱们父母那辈的人可能会有很多的动荡和机会和一些变革。大家有时候会开玩笑说,就是你往上数三辈,谁不是这个田里种地的人,是吧?

39:15 2

然后美国社会相对中国社会而言,我觉得是有一些些这种阶级固化的一些。因为毕竟是一个运行了 200 年的资本社会,很多时候这种资本的得利是比作为一个人来得利要快一些,他们是有这种积累。而英国社会又是一个非常极端的。就我在英国社会的时候就感觉到了这种社会相对更加固化以后,造成的人们之间的关系和你所处的这个社会阶层,和你的这个喜好品味的一个非常大的影响。我觉得中国在这个轴上可能是相对而言,在当时是最百花齐放。

39:53 1

的那美国和英国呢?

39:55 2

我觉得英国可能在这条轴上相对而言是最保守的,而美国是有一些保守,但是都到硅谷来了,大家好像又抛弃了之前的那些旧的东西,在这里又开始开创新的东西。

40:08 1

你看你成功从家里逃离出来了,你成功的离家万里之远,你得到你想要的了吗?我觉得在内心世界上。

40:17 2

在离开的时候并没有很大的目的性说自己一定要拿到一个什么东西,是在路上才慢慢发现自己要做的事情,并且我还是非常喜欢现在自己投身的这个行业和这份工作,也就是对技术是有信仰的吧,可以这么说。

40:33 1

你为什么后来从经济学回到了计算机去了?人工智能这个转变是怎么发生的?

40:39 2

我觉得也是有很多巧合的因素。命运是一条冥冥之中的线,我只能得到这个点。在当时大学的时候在经济系读,然后就是觉得做的事情虽然是学的知识非常有意思,但是做的事情好像就是把一些数字融合在一起跑一跑报表。这种分析可能没有满足我。所以当时是开始探索在大学能够做些什么别的事情。然后很巧合的是大一的时候去了一个实验室做研究。坦白来说,当时的我完全大一对在大一的时候去实验室做研究。

41:17 1

坦白了依旧去实验室了。是的,就很少见。对,因为当时在美国。

41:21 2

在我们那个学校非常流行职业发展,就有一种美国人的劵。就是你大一的时候就会灵魂质问你大学毕业后想干什么?赶紧想好,每天都要为这个东西做努力。所以当时大一就开始参加一些什么职业的交流,就开始搞搞自己的简历。就开从大一就开始弄简历。我觉得我大一好像是入学第二个月就开始在网上到处去投简历。

41:41 1

大一写啥?大一就是之前。

41:43 2

因为搞竞赛,所以有竞赛同学。其实有一个竞赛同学挺有想法的。在我们高中过程中,他就做了一个小软件还去卖钱。我当时也参与了,就帮助了他的这些开发,然后我们也拿了一些小孩子小打小闹的一些钱。让自己觉得能从自己的技能中获得一些回报。所以这些东西都可以写在简历里。因为你是想办法向别人证明就是你是一个信得过的人,可以做很多事情。我觉得即使是现在的孩子们,其实我也完全是有可能。比如说之前 OpenAI 是有高中生去发 paper 的这个先例,我觉得现在孩子们也是完全是可能做到这点。

42:18 2

所以当时的大一我就去找到了在我们学校的一个计算机的组的实习生。然后当时非常幸运的遇到了成为我就是学术路上第一个导师的学姐,她叫李博。他后来毕业以后去芝加哥大学当教授,现在也在硅谷其实做创业公司。当时他选中我的原因我不太清楚具体的,但我猜想可能是因为我是一个学经济学的,我挺喜欢博弈论这个东西。而当时他这个课题是一个叫做 adversity machine learning,就是敌对的机器学习。它是需要有一些对抗的这个博弈论的思想在里面。所以说通过我学的这个比较嘈杂的这个东西,就跳到了经过这个点的连接,跳到了一个稍微不同的方向。然后当时在学姐指导下,比较幸运的,就是写出了一篇 paper,然后也得到了发表。所以我其实大二大三的时候,就因为有了这么一篇第一作者的这个论文发表。后面在博士申请的过程中就得到了一些助力。

43:14 1

博弈论吸引的是什么?你为什么对博弈论非常感兴趣?然后又通过博弈论去做人工智能,这个很有意思,这个连接点感觉非常的微弱。

43:25 2

但是他好像又存在,我觉得就是粗暴一些的归类的话。博弈论中间可能经常会说如果是两个人在玩游戏,他们是对抗的关系,那他们两个人都要做到自己范围内的最好。但是在互相对抗的过程中,他们可能达到了一个平衡。你可能可以通过一些事情来引导他们,使得他们在对抗过程中达到平衡是最优的。我觉得这个点其实是很多经济现在这种市场竞争关系的一个诠释。就是你需要在市场中让大家都去卷,然后卷到最后就会卷到一个其实对整个社会发展有益的一个平衡点。然后把这个思想其实放到机器学习里面,它也是有应用的。

44:04 2

当时差不多 20 应该是 2016 年左右是对抗神经网络出现了。其实对抗神经网络也是有非常多的博弈论的元素在里面,它是需要有一个生成的和一个评判的。他们俩就是互相在玩这个游戏,生成的人就打一个不恰当的比方,就在做假钞。然后评判的人就需要分辨,就是你做这个钞票,它究竟是真钞还是假钞。在这个过程中的最后可能会引导这个生存的人不断的去生成一个越来越像真钞的假钞。而对抗的人最后就是当他们真的完全无法分辨的时候,他就没办法,他就只能靠猜。

44:38 2

所以大家通过这个思想,就是在当时创造了一批图像生成的技术。都是靠这个生成器去生成一些看上去像真实世界的假钞,就是这种假照片。但是这个逐步对抗的过程中,这个照片就和真的照片没有差别,所以使得这个身上的照片看上去更加的真实。所以这个博弈论我觉得应用其实在机器学习中是非常的广。一直到今天,我觉得在机器学习的安全和怎么样帮助机器的这个就是不管是思考方式还是生存方式,更像人类都是有挺广的应用的。

45:16 1

你真正开始做人工智能的研究,除了本科做过这一篇论文以外,是在博士了对吧?是的,你博士之后的学术路线是怎么展开的?你的主线是什么?

45:27 2

我在博士期间也换了一些方向,因为当时第一篇论文发表的是一个偏博弈论的这么一篇文章。所以在刚入学的时候,我以为我做的是这个偏理论的机器学习。但是当时做着做着之后就发现自己其实更喜欢做应用。所以后面就去做了机器人这么一个应用。

45:50 2

在机器人过程中,我自己的研究路线其实是从模仿学习开始,然后最后做到了强化学习。这个模仿学习我感觉要形容的话,其实就是就人家已经知道了怎么做一个事情,所以他给你提供了一个样例,你就想办法去超出这个样例来,这是模仿学习。但是随着模仿学习的研究的不断的深入,我就觉得有些不满足了。我觉得如果你永远只是在照抄别人的话,你其实不能够就现在也很经常讲的不能够有创新,不能够有突破,所以就转入了强化学习。强化学习更强调的是怎么样通过你自己的这个探索,去突破原来的这个表现,去把这个上限推得更高。我觉得这个其实也和性格也是有一点相贴切的。所以现在的我更多的是做强化学习。

46:40 1

在你开始研究机器人的时候,当时的主流是什么样的?你这个研究方向是一个主流的还是。

46:48 2

一个边缘的?我觉得在 2017 年,它是一个星星但不是很大众的一个方向,就是把机器学习放到机器人上面。包括我自己去找到的实验室的和他的老师,他们都是更加偏向传统这一派系的。因为机器人其实发展到现在发展了几十年了,然后也有很多很成功的应用。比如说大家会笑话说,我们都让火箭上天,都可以在火星上开始探索,这些都有用了很多机器人的技术。

47:21 2

然后传统派系在 2017 年左右,传统派系更多讲究的是一个路径规划和控制问题。其实这个我觉得是非常符合我们人的一些直觉的。就是你就要做一个事情,你就先规划一下,我要做第一步、第二步、第三步分别是什么?要把它们连在一起,形成一个完整的计划。计划了以后再有这个控制去慢慢的给他执行,保证你在每一步上都不出错,都能够贴切的完成。

47:48 2

而在 2017 年,因为我是从机器学习开始起家的。所以我当时就在想说,其他有很多领域都可以从数据中去学习。我能不能把机器人的这种透明材质,也不是在靠我去给他制定什么规矩,而是从数据中直接获得。这个想法和我所处的这个传统偏传统方法的一些实验室,是比较小众的。在在我们实验室就是只有我一个人做这种类似的方向。

48:16 1

就是你导师不是做这个的。

48:18 2

我导师不是做这个的,我导师他它是传统派系的一个做路径规划,有很多工作做控制。他他是一个怎么说呢?全栈系的人物,就传统的机器人实验室,他是从卡莱西梅隆那个派系出来的。他们就很强调说你每个人都要做全栈,就是你要会造机器人,你要会知道怎么把机器人搭在一起,这个机器人的一些什么动力学分析你也会做。然后你还会做对你规划,还会做这个控制,然后还会让他做一些事情。最后你在这样整个链条上面,你可以选一些你比较喜欢的点去深入。它是很强调一个人就是在一个最极端的情况下,是可以一个人完成几乎所有的任务的。所以他在培养学生的时候也是照这个路子走。

48:57 2

我其实很感激,他对我的这种培养,让我觉得我对机器人的上下游的一些事情是有一些了解。就不说多深入,但至少就是差不多测绘是能用的。然后在他的实验室里做机器学习,或者他的态度也是非常有意思的。因为。当时机器学习刚刚开始,就是大家做的事情还非常的怎么说乃也就是比起传统机器人都能够上天了。你这个机器学习刚刚起步做的什么任务,看上去也其实也比较的幼稚。但是当时导师在交流的过程中,就是忌讳给我指出,很多现在做的这些任务,其实以前都有人有更好的方法解决,是这么解决的,你要去学习一下,你要再继续学习的。

49:40 2

这个做的过程中,同时也就是知道以前的人是怎么做这个方法的。他给了我很好的这个台阶,让我去在他基础上去学习。同时他也会让我有一个比较开放的一个想法,就是我会把很多积极学习的想法带给他,然后告诉他我觉得不停的在这种一问一答中对抗的就搞明白了,就是我为什么这么相信机器学习的机器人。因为传统方法中的这些,我觉得是太依赖 expert 专家的这个东西。我们机器学习我觉得一个很大的使命就是让专家从这个机器学习的这个中间消失,就是机器可以自己学习,这是一个使命。

50:19 1

你的导师是那个。

50:20 2

C 的对吧?

50:21 1

对你如果是一个机器学习的信仰者,你为什么会进他的组呢?以及你是怎么开始对机器学习非常感兴趣,就是这种对这种数据驱动。

50:32 2

的机器学习。

50:33 1

因为懒。

50:34 2

因为这个事情其实有点有意思,我觉得知其然不知其所以然,是一个非常微妙的一种状态。可能大家有些人会在有一些问题上,大家也会想要打破砂锅问到底。但是在优化问题里面,就大家都很想优化。我觉得性格上是有一个想要更好更强的一个部分的。在优化过程中有一类优化问题就是黑盒优化问题。就是你也别管,你也别问他到底怎么样,就给了一个非常好的解。反正你只要知道你如何设计一套系统,让它能提供一个比较好的解,你不需要知道这个系统最后是怎么运行的。

51:06 2

其实这也是我觉得 20 1617 年左右自然语言系的一个很大的争论。就是传统的自然语言会使用这个语义结构,就是这种更贴近人是怎么理解,就是语言是怎么运作的,就把语义分成很多不同的部分,是需要很多专家去了解学会,然后再想办法把它自动化喂给机器。而后来的数据驱动的话,就是完全也不能说没有受到之前工作的影响。但确实它的运作方式彻底的改变,变成了从数据中直接学,中间的这些步骤都可以略掉,就是变成了端到端。我觉得机器人可能也是要走一下这样的路。

51:42 1

那你为什么会进一个传统的组没有选择?

51:46 2

因为当时机器人不是一个特别流行的一个选择。在 20 1617 年,其实机器人的发展历史的话大概也就是 50 年。而且机器人是一个非常烧钱的一个领域。

51:58 2

当时我们的一个内部笑话就是看隔壁一个非常牛逼的自然语言的老师的组,他是耶稣 choi,他其实做了很多 common sense 牛批的贡献。当时他们那个组 2017 年就开始做了很多数据集,然后说就从来没有人烧这么多钱在数据集上。我就说数据集烧了多少钱?20 万美金,20 万美金。我的天哪,你在这边买一个机器人要多少钱,你知道吗?你这机器人坏了以后修了多少钱,你知道吗?所以多少当时 2017 年,隔壁组有一个 shadow hand,50 万美金还是 100 万美金来着。然后修了以后,就大家自己在大家现在让这些博士生宝宝现在这个屋子里面先想办法把修好,不要把它返厂,一返厂就是十几万没了。当时还有巴瑞看的也是就是一个多关,也不是多关节,就是一个三个指的一个省区的一个手。当时是十几万美金一个月,它坏了也是修起来够强,要半天,就当时的这种硬件的成本和需要一些专家的知识的知识,使得当时我觉得机器人不是一个特别流行,然后人数也比较少。

53:08 1

非常昂贵。

53:09 2

对。

53:09 1

当时都买什么硬件?当时逐渐开始有人买 franca 这个硬件。

53:14 2

因为当时 franca 我们是相对而言最便宜的。你现在这个时间点看 franca,你也觉得好贵,怎么我忘了当时拿的价格是多少,但是反正就是几万美金。

53:27 1

他就号称是最便宜的。

53:30 2

现在还是有人用 franca,因为我知道之前 franca 被一家中国公司收购了,还挺唏嘘的。大家也不知道以后 franca 会不会挨出了一个中国版。可能就几千美刀,说不定就可以了。因为现在很多中国的硬件应该都是在五六万美金左右上下的价位。就是单纯从手臂的角度上来说。

53:48 1

其实还不到 10 年的时间,对吧?从你开始读博到现在。

53:52 2

是的,你是哪一年读博的?我是 17 年入学的。

53:57 1

17 年入学其实这里我们也讲到了机器人历史,你能从你的视角来给我们回顾一下你说的这个过去 50 年的机器人的历史。

54:06 2

对我的视角可能不完整,我就尽量复述一下,就是我感受到或者我接触到的一些比较有代表性的研究人员。我觉得机器人的发展史可能绕不开。第一个就是卡耐基美隆大学的一些发展。卡耐基美隆大学是有一个自己的机器人研究所的。这个研究所大概是在 79 年 8 几年的时候开始建立,所以至今大概是四十多年的时间。当时他们开始研究了怎么样让机器人就通过感知去看,然后做一个决策去做。所以我觉得这个看加动的这个结合,就是从他们开始慢慢的变得非常的 popular,就是拍上流行起来。然后当时他们也发展出了很多不同的分支,不管是让机器人能够去决策以后,就把它放到真实的环境中去做一些灾后救援。

54:53 2

还有当时就是 2000 年左右的这个自动驾驶。当时 CMU 卡耐基民族大学在这个里面一鸣惊人,突然一下大家都觉得他自动驾驶可以开始做。当时 0405 年的这个德尔塔,就是国防部的这个自动驾驶的比赛,刺激了后面很多的自动驾驶公司的。大概 06 年就开始创立,我觉得这个也是非常非常有激励的。然后后面的话看来基美隆大学我觉得有发展一些,就是现在对我们最相关的话,可能是就是有一些机器学习的学者,也有一些操纵系的 manipulation,就是用手就机械手去做一些事情的学者,也有一些是研究如何机器和人的生活中共存。

55:39 2

其中可能比较有代表性的话,就操纵系因为他是算是我的祖师爷,所以对他的了解要多一些。他的名字叫 mac Mason,他现在是还在互联网上活跃,他有一个个人的博客会写一些他对操纵系的看法。他其实最有名的一句话是就是他觉得我们现在强调了很多灵巧,他觉得是不是从你这个手指和你的硬件的关节构造,而是从你这个大脑如何去操控一个即使很简单的一个结构,也能做到一些很复杂的任务。他觉得灵巧的关键不在于这个手本身,而在于大脑。我觉得我的研究也有很多受到他的影响。因为我在博士期间也就是筷子机器人,就是用一双筷子做几乎所有的事情,是我当时的一种想法。然后他当时带出的学生,也就是我的导师就是谢 new wsa。所以他的话他会做了很多路径规划,也是做了很多有一个什么机器人酒保,就是你怎么样去拿一些不同的杯子或者可乐,然后再把它递给人这样的一些研究。

56:42 2

然后除了这个派系以外,当时卡耐基梅隆发展,当时那个腿和生物的这些机器人是有很多人研究的。就是 matt 梅森祖师爷,他还有另外一个弟子叫桑贝贝,桑贝他做的就是一个生物狗,就是当时 MIT7 他就是他开始做,他在在 at mission 这里学,但他其实并没有就做操纵性,他就去做一些生物激励的一种形态,所以他就做了狗。他去 MIT 当了教授以后,就做出了这个 mini 器塔这么一个非常有影响力的工作,可能说是现代的这些机械狗的奠基人。

57:16 2

然后其他以外做腿的话还有一个比较知名的学者可能就是 mark reybert。他是迈特威森的,同期他去做了波士顿动力,也是先做狗。但是他走的这个路线可能是传统派系的一个极致。因为当时他做之前的话,大家其实觉得就很多事情是受到电击的限制。他就想做非常好的电机,能做大家想都不敢想的事情,他确实做到了。我觉得他做的这个在忘了是什么年份了。但当时他作为世界上第一个能够后空翻的机器人,告诉他这个事情其实能做。影响了一批的学者。然后我觉得在你是 CMU 这个派系的对吧?

57:54 1

我觉得虽然我不在。

57:56 2

CMU 读博,但你可以看到就是我的学术族谱是很多受到这边传统派系的影响的。然后在另外一边的话,我觉得派系上可能还有机器学习这个派系。因为机器学习的话我也不清楚,就是更早的事情可能明明斯基还是一个 MIT 的学者,他可以认为是现代机器学习的一个创始人。但是在我这个年代,当我开始学习的时候,我们机器学习的入门教材都是看安卓 NG 吴恩达他的。在线的网课。这就是我大学时候去了这个实验室。

58:30 1

在融入智能里面,他们好像也属于两个派系。

58:32 2

其实可能是的,但是对我来说就是更早的事情,可能我都没有那么多的关注了。在我看来我能看得到部分就是我们 1415 年开始做人工智能。学姐就告诉你了,这是一个教材,先把这个教材读懂搞会,就开始跟着吴恩达的网课去学习。

58:49 2

然后吴恩达的一个博士生是 Peter a bill,他是应该是最早的一个把机器学习放到机器人这个领域上的一个比较先驱的教授。他现在是在伯克利做销售,也是依然是一个活跃的研究员。他现在应该也同时在亚马逊担任一个把他们这个研究部门的一个领导的一个职务。然后皮特尔 bill 他当时做了好像是做了一个会飞的飞行器,然后他有了搭载了这个机器学习算法。因为他做的这个工作的年份比较早,我现在其实对他更多的了解是他后来的学生就是 service the wine。

59:28 2

他的工作,我觉得 Peter 和 sergey 这两个人可以说是把强化学习在机器学习中比较发扬光大的。因为他们的发表的数量非常的多。然后 surgeon 现在也是我在派的,算是我的汇报对象。他是创始人。对,他是派的创始人,派的创始他也负责了很多我的派现在做很多强化学习的工作,所以是和 sergey 一起做的。

59:51 2

Cr gay 当时在就很有意思,circa 他自己 PHD 学的其实不是机器人,是 graphics,是做这个图像的。然后当时在 Peter bill 手下读博士后的时候才转型,我还挺欣赏,大家从一个领域做了以后就转型到另外一个领域。我觉得你能转过来或者你想转过来,肯定是有很多你的想法,所以 circle 当时应该是有很多想法,他就做了强化学习这些课件。

01:00:15 2

其实当我开始读博士的时候,我对于机器学习的很多没有什么教材,都是看 C 的视频,然后看他们的一些讨论,包括看他的论文,然后看他们组的一些对话来学习的。然后 circuit 他,后面也有它的合作者 Chelsea,Chelsea 和 service 都是派的联合创始人。我觉得他们两个都是对现代机器学习到机器人应用做出了非常多的贡献。不管是学习的算法,还有包括硬件的设计都是有很多贡献。

01:00:49 1

然后和 chouse 他们是是什么共识关系?此前如果我。

01:00:54 2

没有记错的话,应该 sergey 是 chose a sometime 就是 collaborator 或者 slash,办一个是应该可能也许就是抄写的 postal 适合 sergey 读的。

01:01:06 1

然后他们后来一起创业了,做了派对。

01:01:09 2

他们俩之间的学术关系非常好。就是我觉得他们俩非常的同频,在公司他们其实也是经常在一起讨论问题。

01:01:15 1

这两个人有意思吗?有什么有意思的观察没有?

01:01:18 2

孙越是个科幻小说重度迷,我不知道别人读 pad paper 有没有发现,就派很多 paper 上面会有一个来自科幻小说的一个引用,全都是孙姐写的。他就会他会去思考这些事情。然后有人说。

01:01:33 1

过他非常会写论文标题。

01:01:36 2

是的,我觉得他是一个讲故事非常强的教授。同时他就是内部笑话,可能就是说 surgit 就像 sergi GPT1 样,在在这个人工智能 ChatGPT 出现之前,伯克利的人就已经用上了 sergi GPT。你的论文写的怎么样?把草稿就直接发给 sergi circuit,就给你了一个超级 polish 超级好的一个版本返回给你,而且又快又好,就像 ChatGPT 的前身版的。即使 ChatGPT 出来了,他也不能和 sir gi GPT 在论文修改方面相提并论,这是一个笑话。

01:02:06 2

然后敲水的话,它是一个非常 discipline,就非常每天他都会四点钟起床,然后去去去游泳,然后有 1 个小时。他是一个对自己的一个生活,我觉得非常有规划,非常 inspiring。而且他是一个我觉得有动物性直觉的一个人,就是和他聊很多机器人的具体的一些动作和表现,他有非常多的非常快的一个他觉得这个事情怎么样的。然后这个里面有非常多的这种直觉性的推理,能够感受到他对这些动作任务有很深的认知。比如说直觉性的。

01:02:40 1

推理有些比如说。

01:02:42 2

就有一有一段时间里悄岁是负责管派的这个数据收集的。就他对数据收集到底该收集什么样数据有很我觉得他有很深的理解。其实后面谭派林的时候也可以多说一些,派凌的很多任务是有敲 C 在后面推动,他觉得能做。因为当时其实大家是不知道能不能做的,所以他们两个是互补的,我觉得可以是这么认为的。他们的工作。

01:03:09 1

关系这一派别还有其他人没有,刚才说了文达以及他的延续,我觉得现在。

01:03:16 2

的机器学习机器人其实挺百花齐放的。然后包括有另外一些派系,比如说就从菲菲她还带了很多学生也投身了机器人的研究。比如说可能现在这个时间点上,大家比较看得见的有朱玉可和金范。他们现在是在都是非非的学生都在领导,毕业以后都我觉得御可是当了教授。然后现在他们在领导这个英伟达的 gear lab,在英伟达就是主管,就如何做机器人。

01:03:45 2

然后包括我觉得现在其他华人学者,比较有名的可能有宋书然还是我非常尊敬的一位女学者。然后苏淑兰其实之前他做他们有做做这个 diffusion policy 是舒然组出来的。然后 ACT 和这种 allow a 是乔组出来的。我觉得这个都是对现在的机器学习机器人的形态产生了重大影响的里程碑式的 paper。

01:04:15 2

然后其他的还有 CMU 派系,其实也有很多现代的机器学习的人我觉得可能比较 visible 的应该是两个人,一个是 depart,还有一个是阿贝娜。其实阿贝娜是一个资历比较老的教授,他是之前做这个视觉出身,然后他有非常多天马行空的想法。我跟他就之前短暂的合作过一个一阵子,几年前我就感觉到他是一个无法预测他下一下一秒会说什么。然后有的时候我觉得他看的东西就非常有创造性。比如说他其实很早之前就想做一个自学习的这个机器人。比如他当时做视觉就说了,就是视觉我们经常说只能受到数据的限制,那咱们就做一个,就不要数据限制,我们就做把它放到机器人上,让机器人去户外去各种收数据,这样不就可以打通。我觉得他做的东西是有一种几乎野生般的,说将来最后可能还真就是这个形态这种感觉。然后包括他其实就大家现在可能更熟悉优米,就是作为一个机器人说数据的一个手段。

01:05:15 2

其实很早之前阿宾娜也做过另外一个就是叫做我忘了他起的是什么名字,反正他的他当时就说我们去亚马逊上买一个五刀一个的东西,这个东西就是一个很长的一个杆儿,然后这个杆儿的末端是一个小夹爪,然后你按这个杆儿,它就会夹爪把它夹住。他说我们就是这个杆儿去收这个数据,跟现在的幽冥有异曲同工之妙。然后当时 depart 是后来加入 CMU 的 depok。他其实之前做过 curiosity,就是好奇心驱动的强化学习。所以它其实我们在谈他的以前的工作的时候,更多是把它归类到做强化学习。很出名的学者之一。然后 debug 和 APP 现在是共同创造了 skilled,也是硅谷非常有影响力一家机器人公司,也是做全身智能的大脑。

01:06:03 1

他和你们一样都是做大脑的对,都是做大脑创业公司,然后还有一些大公司也在做大脑。

01:06:10 2

对我觉得是。

01:06:11 1

你很有意思,你是从前面这个控制或者叫传统派别跳到了这个机器学习的派别,对吧?然后现在机器学习的派别似乎是硅谷这些涌现出来的创新公司更多的人。所以现在好像是主。

01:06:29 2

这一波最流行的是机器学习机器人。但其实我觉得这个。

01:06:32 1

博弈关系肯定历史上一直在发生变化,对吗?就是两派你讲讲这个。

01:06:37 2

我觉得历史上的关系的话,就机器人其实大家做了这么久,而且我相信很多做机器人都有信仰,就是什么东西能让信仰成真?不同的时期都有不同的,大家叫 have。这一波可能是机器学习机器人,也是我们现在投身的这一波。之前还有一些做 slam 的,甚至包括我觉得之前做自动驾驶也是算让更多之前还有 planning control 做到极致,我觉得不是的。动力也是一个代表,这些都是不同的思想的碰撞。要想把这件事情做成。

01:07:08 1

在你入学的那个时候,前面这一个派别是占据根主导的力量。

01:07:14 2

应该是我记得当时去传统机器人的一些大会,比如说像 IOS 或者 equal 这些会发 paper 发论文,就觉得大家做的跟我做都不一样,我们做的算比较小众的东西。

01:07:27 1

那你有想过转转过去吗?因为你导师就是做这个的这倒没有。

01:07:31 2

我觉得我相信我做的东西,所以我做起来快乐,所以我相信我们做的这个行业,即使导师他会有的时候会就是批评或者指出。

01:07:40 1

还批评你什么呢?

01:07:42 2

比如说有一部分机器学习,当时就是还比较受限,算法比较受限,他就。在模拟器里跑比较多,他在真机上面就不是很能跑得起来。当时就说你们这样就满足的话是不行的那就不够好。你看我们传统拍戏所有东西都能上真机,你要把你们这个东西放上真机,我觉得它是一种指明了发展的时候该如何思考到底怎么样有用。这件事情上面走的比较早,因为可能对当时还是一个新兴的领域来说。如果去一个专门研究新兴领域的时候,可能没有那么多的去想落地,想想怎么样表现好这个事情。但是因为导师是从传统派出身的,他们这些衡量指标很多影响到了我。

01:08:22 1

你们两个会有。

01:08:24 2

一些争执吗?经常会。

01:08:26 1

因为信仰不一样。

01:08:29 2

想法不一样,包括像我们这种喜欢偷懒。你看我做机器学习的一个很大原因,就是如果一件件事情我不需要理解它的原理,我就能做出来,我还是做出来了,对不对?导师就会觉得这个不优雅,而且就是没有什么保障。我说优雅我们保证不了,但是保障我们可以再多做一点研究,看看能不能给他再搞上保障。所以它是有一个本质性的,就是对于解决问题的一个方法的喜好。我觉得我就是那种黑猫白猫,抓到老鼠就是好猫的这类。所以什么黑盒优化,我说黑盒优化非常好,你只要你能够把你这个任务定义的非常好,咱们就可以和优化。

01:09:09 2

老师会觉得你这个力的作用是什么?摩擦力的建模你都不太懂,你怎么就在做这个任务。我说说不定这个任务不需要你懂这些的。我们的目标就是让很多不懂这些前置知识的人都能把这个任务做成。怎么样让这个信息的流动变得更加的轻松,是我觉得我们的一个主旋律。

01:09:27 1

这里很大的一个。

01:09:28 2

驱动力是实用,我觉得是实用,而且是一种信仰。就怎么把它做出来,我要在当下时间点选一个我觉得最有可能做出来的方法。我不太相信传统方法里面,我觉得我们应该都能 benefit,就是从传统方法中受益。但我不觉得我们就用传统方法就够了。我觉得这个是大家其实是比较有共识,就是他如果把所有的问题都出现了一个投入和产出这个曲线的话,传统方法是一个你投入多少年产出比较清晰的一条线。

01:10:01 2

因为当时机器人动机器人,比如说波士顿动力,他们做这个后空翻是非常牛逼的。因为当时都没有人敢做,也没人敢想,但是他们做出来的。但他们代价是很多很多的工程师不停的去调试这个参数,去适配他们想做的这个任务,去做到他们想做这个效果。你再做一个新的任务,你还是得有这么大的一个投入才能把它做出来。而我觉得机器学习的算法,第一是我们不要工程师来做对吧?我们就是通过各种各样的设置让算法自己来做。你作为一个工程师,你的工作量就小了。比如说现在的这些很多比较酷的这些跑酷的这些视频,可能就工作量和那个年代就不可同日而语了。

01:10:44 2

然后第二个就是一旦一些事情需要更少的人力去做以后,我觉得交互也会发生变化。怎么样让普通人都能够交互?比如说现在这种 AI 智能体的发展,我觉得可能刚出现的时候还是一种比较小众的。你要用,因为它有时候不好用,你要作为一个专家知道怎么去用才能用的更好。我觉得机器人现在也有点处在这个状态,就是很多时候可能可以跑,但是你可能需要专家来大概了解他跑的一些问题是什么,然后提前做一些修正才能跑得更好。但我觉得总体的发展趋势是让一个普通人也可以非常自然的去和这个智能体交互,得到他想要的一个结果。

01:11:18 1

我一个地方比较好奇,因为我觉得在传统派别主导下的机器人发展,当时集大成的一个构型好像就是狗。这个是为什么?当然我相信他们肯定觉得狗不是最终的那个构型,但为什么那个时候时间段大家都觉得应该去做一只狗呢?

01:11:37 2

这个我真的不知道,得问三倍,但是我觉得看到一个狗跑起来,我作为一个机器人的从业人员,我也觉得有非常的受到启发。而我觉得这一波就是大概在 17 年到 20 年。因为我们的在华大有很多不同的实验室,有隔壁实验室,他们是做狗做的很多的,就够作为一个硬件平台,它的可获得性相对而言还不错,其实我觉得可能比机械臂还要好获得。为什么写?

01:12:16 2

操纵系的一个绕不开的难题就是刚才导师说的这些问题。就是我不知道这个摩擦力,其实每一个物体它都有可能不同的摩擦力。这个话筒,我们自己的衣服,还有这些褶皱。千千万万的事情就很难去建模。然后如果用传统思想去做的话,你都要建模。你不清楚你的行为会有什么后果的话,你怎么能把这个问题解决?

01:12:38 2

我觉得是传统的一个比较大的思路,也是一种模型叫物理模型做的算法的一个思路。而狗的话它的这个接触更多的是一个顺势的,就是我这个腿在这个地上跑,我只要碰一下,然后很多时候他是不太需要你详细的去搞明白,就是我的这个腿在这个地上的摩擦力。所以我觉得这个问题的需求就是狗可能需要更少的物理知识,而操控器需要更多的物理知识。所以造成了操纵性做出来比较好的东西,相对而言狗而言可能要少一些东西。

01:13:15 1

我们刚刚讲的这两个派别机器学习什么时候开始占据主流的?是从哪一年是这个转换点?你是是哪一年从本来虽然是一个小边缘的一个方向,然后变成相对大家愿意投资源更关注的一个方向。

01:13:31 2

我觉得身在此山中很难讲清楚,但是差不多就是疫情那会儿,第二第三年的时候,我当时刚加入实验室的时候,做了一些比较偏理论的工作,然后也是在模拟器中跑。所以导师就说了,在模拟器中跑最好有什么用呢?也要上真机。

01:13:49 2

我就大概在 18 年的时候开始,就从头弄了一个机器人,就做了一个筷子机器人。是我买了这个组件组装,然后搭起来,然后给它写系统,给它写系统让他跑起来,后面还给他做了很多建模的工作。然后当时开始做这个,做的有一些成功了以后,就是把这条路打通了。那实验室的人可能就能够同学交流就能看到就是说如果有一个新的方法,他有可能成功。我们在做我们的问题的时候,就要去积极的去尝试拥抱这种新方法。所以当时实验室里其他人的项目,都或多或少也不是说我直接参与,可能都给他们一些反馈。

01:14:25 2

就是说实验室里有一个人在做这个喂食的项目,可能就是说有些人他生活不太能自理。我们怎么样就是通过一个机械的一个轮椅,它搭载了一个机械臂,它可以去给这个食物来给你喂食。他们本来的这条流程是非常传统的。你先搞明白,就是下面要吃一个果切,这个切了一半的果子在哪里?

01:14:46 2

它的路径是这样,我们路径规划过去,然后一个什么样的路径把能把这个果切插到这个叉子上面,然后再一个什么样的路径给它喂到这个人。就这套思维比较传统,但是他们是有一些可能一些限制的。比如说这个果切的位置在哪里,他们是就是依赖于这个计算机视觉的那后面他们就会想说,那机器学习在机器人上可能可以做的话,我们可不可以把这段就不光是用一个视觉别人训练好的神经网络来用。我们也积极的去尝试,就是让这个机器人自己去积极学习一样去设置,就是学习或者发现一些更好的路径,所以逐渐开始我觉得大家也会讨论应用到不同的问题上的可能性,逐渐开始就接受。

01:15:28 1

你当时为什么会做一个筷子机器人,为什么喜欢。

01:15:32 2

这个动作。当时我忘了是怎么回事,就是跟导师谈聊天的时候,就突然就发了一条暴论。就是说我用筷子能做 90%的问题。

01:15:44 1

90%是桌面的问题。

01:15:46 2

还是什么问题?就是夹和放这种问题,我一直是之前是有一些觉得。

01:15:52 1

筷子好难,筷子只有两个支点。

01:15:54 2

对,就是因为我觉得用筷子就能做的话,其实如果算法在筷子上都能成功,那它说明在其他方法可能更容易的成功。就是要做就做一个非常难成功的东西,把它做成功,我觉得剩下的就可能就是一些工程问题,这种做研究的思路也是我自己比较喜欢的,就是你做一个非常难的问题。然后当时就跟导师聊天,你也知道我们这个派系其实是非常相信简单的机械手的,就比较优雅,的都是睡衣回家了,所以当时就给他打了一个赌,就是说好像不是不 2。

01:16:24 2

我跟他说我想做一个自己的机器人,他就说你想不想跟别人一起做这个轮椅机器人?我就说轮椅机器人虽然很好,但是他们的这套系统已经写完了。这个系统太传统了,我觉得它不是很适合我想做这个机器学习,我想自己弄一套东西。他说要不你可以自己从头搭一个,你想搭什么对吧?然后我就看了一圈,我就说我们要做一些操作非常难的。比如说之前美国电影里面,其实是有什么筷子夹苍蝇这种,就是对中国武术的无限畅想。所以我导师他是一个印度人,他就说搞一个这种你能把它做出来就会毕业了。我就说那就好,那就开始干。

01:17:01 2

然后就从这个实验室的仓库里面捡了一个别人其实之前用过,后面就没有什么人用的一个机械的一个组装部件。然后我们就可以自己自由组装。我其实很喜欢这种自由度,所以开始做起了筷子机器人。

01:17:12 1

后来做到什么程度了?

01:17:13 2

后来做什么程度?我觉得应该就比较有代表性的工作有两点。第一点是做模仿学习。我当时就是想办法让这个筷子机器人做一些非常精细化的模仿学习的任务。其实背后的想法是这样的,就是机器学习它是一个天生就带有泛化性的一个希望的一个东西。大家都说如果机器学习在问题 A 上能成功,那他就能够比较无缝的衔接到问题的 23456。但这个时候传统派的人可能就会说,你的问题也解决了,你的问题做到了什么效果?就是如果机器学习的终点是一个什么都能做,但什么都做不好的机器,这显然是不够的对,所以我当时就想说,那我就先在问题 A 上面把它做到极致。

01:18:00 2

当时我搭的这个机器人,不好意思,我们是手工搭的,也没有针对很深厚的硬件背景。所以它显然不是按照传统的人来看的话,不是一个最好的机器人的形态。那里面的很多力,还有什么调的,可能都没有调的特别好。我当时就说如果我们有数据驱动的话,我就偏要在这上面做出来。因为我相信数据驱动,因为数据驱动一个很大的一个验证点,就是当时我搭完以后,我就跟老板说了,这个东西一定能做出来,为什么呢?因为我虽然用这么一条不是很准的一个机器人,但是如果我做一个人去窑操纵这个机器人的话,它再不准我都能让他做到筷子夹小球这么一个。

01:18:33 2

就是我们老板他也不不那么会用筷子,他自己用筷子都做不到这个。但我可以操纵的这么一个不准确的机器人去做到这件事情。我就跟他说,你看硬件已经搭完了,然后硬件你觉得不太好,有点嫌弃没关系。只要它的这个操纵算法是和我一样聪明的操纵算法,它就应该能用这个筷子去夹御这个小球。即使它的每个关节上都有一些这样参差不齐的怪怪的调仓,或者一些 back lash 就不太准确的东西。所以当时就打了这个赌以后,就是第一篇工作其实是 2018 年 19 年就做出来了,就是可以用筷子去夹这个小球。

01:19:09 2

虽然这个问题做出来的方法是有很多的,就模块化的东西现在看来都是有点过时了。比如说当时是需要有一个外在的一个系统去搞搞明白小球在哪儿,然后我们在这边在极致性的去抓那个小球。现在可能都更加的断刀断了。

01:19:25 2

然后做完这个工作以后就跟导师说,我觉得不够,因为我夹的还是慢了一点。毕竟我是咬操纵这个机器人,我就时时刻刻在调动调整自己的动作。我是在尽力的就花费了好多的精力去给机器人提供一个非常高质量的数据,让他能够更好的学习。但这样的话太累了,我们懒人怎么能做这种事情呢?我们要让他自己去探索,去发现怎么样超越我给他的这些数据,让他做的更好。

01:19:52 2

所以后面的话工作重心就转到了强化学习开始做了让机器人去在现实生活中做这个事情,不断的去练习,通过练习归因来让它变得更好。我觉得这个是有点像可能之前会看一下奥运冠军的访谈,就看他们的训练就来激励自己。就觉得就做一些要想做好一件事情,尤其是这种动作性的事情,你确实就得适配,就搞出一个策略,它最适合你的这个机体,并且就不断的锻炼你的机体,让你就是刻出一个肌肉记忆。对人来说,对机器学习来说,我觉得其实就是一个。

01:20:25 1

强化学习的过程。所以你是做了这个筷子项目之后,才去转向了强化学习把中心。

01:20:31 2

对我就是从理论的机器学习开始做,然后不太满足于理论想做应用。然后做了应用以后,第一个算法其实是一个模仿学习的综述算法,在只能在 simulator 里在在模拟器里跑一跑。后来不满意做了真机做蒸汽,开始做模仿学习,做强化学习。最后这个强化学习的工作其实是可以在空中有一个非常会晃动的小球,人夹都有点难度。但是我可以用这个机械手去给它夹住,因为它是一个它还是可以夹一个玻璃球。这种准确度就这种准确度确实比一般的机器学习的任务要求已经高出很多了。

01:21:05 1

我们后面还会再来聊强化学习,我们现在先回来讲讲,继续讲讲这两个派系。这两个派系你觉得他们互相之间有鄙视链或者某种程度的价值观的冲撞吗?体现是什么呢?

01:21:16 2

我觉得鄙视链,我觉得大家可能或多或少都是有一些觉得你做你最相信的东西,别人东西你可能没那么相信你相信的话你就去做了这种感觉。

01:21:27 1

因为在今天可能 machine learning 已经变成了一个相对来说共识了。我不知道在当时他们真实的状态是什么样的,以及你说机器学习和传统的这种方法,哪个是更优雅的呢?这个评判标准是什么呢?

01:21:43 2

我觉得优雅是很主观的。在当时那个年代,我记得就是在我读博过程中,我们是从一个比较比较新兴的一个分支,逐步变成了一个大家比较愿意接受的一种算法。在当时是有一些质疑的声音,我觉得他们质疑其实也非常的正确。他们问的是一个基于事实的。比如说你什么东西都能做,但什么东西都做不好,那么要这个算法的用处是什么?这是一个我觉得在当年非常有意义的一个 concern。就是当时大家做很多东西,你往前看的时候是不明白,往后看的时候可能才发现能够溯源到某些代表性的或者有贡献的作品。而当你决定下一步做什么的时候,你达到这个目的,我觉得我自己的研究起码是有受到这种思想的启发。

01:22:32 2

就是我想让机器学习在一个问题上至少能做到极致。这样别人在把它泛化的过程中,可能会有一些比较简单。因为他可以从我的这个经验中直接放到别的任务上。泛化和表现的冲突还是最核心的一点。即使到今天我觉得这个质疑依然没有完全消失。

01:22:51 2

甚至包括我们作为从业人员,也是在一直思考一个传统的机器人的一个链条。在工厂比如说造车,你要把用一个很大的机械臂把这个玻璃给放到这个车上去。这是一个传统已经做的非常成熟的,成功率、稳定性、速度都非常有保障的一个问题。

01:23:12 2

你现在用细学习拿到的这种算法和表现和传统相比的话,可能暂时还没有人能够说我们这个鲁棒性是和传统那么一样的话。我觉得直到今天都还是一个研究的前沿性的一个问题。然后另外可能当时我觉得还有一个比较有意思的,就是我不知道你有没有听说过一位学者叫吉他者集团者。他是伯克利的一个做 computer ation 很有贡献的教授。他之前说了一个很有名的话,这个话太好玩了,robotics is far too important to be left for robot。就是说机器人太重要了,我们不能只让搞机器人这帮人来搞,我们也得搞。这个话其实有很多不同的诠释方法,还有一个不太有友善的诠释方法,可能是说机器人太重要了,这帮搞机器人都不行,我们我们得我们上才能把它搞出来。但我觉得也有一个比较友善的诠释方法,可能是要想把机器人搞出来,必须得有不同行业的人群策群力。

01:24:13 2

我觉得这对当今的机器人大模型发展是有启示性的。比如说我是一个比较传统的拍戏出身的,我可能很多会关注这个动作机械本身,还有这个表现的精益求精。我也会做算法。但是在我的领域之外有很多这种做这种视觉的人。他们有一些更多的就是如何引入更多的数据,如何训练更多的数据的经验。包括做这种大语言模型的人,他们有更多的大模型学习经验。我觉得机器人的成功一定是一个各行各业都放到一起来。就是有软件算法,有不同的行业的训练,有大模型,然后也有硬件,甚至包括这种产业链才有可能把机器人做出来。

01:24:56 1

你说的这个传统派和继续学习的派系,他们在美国的这个分布是有聚集。

01:25:03 2

效应的吗?偶然性的是有一些的。因为西海岸这边就是斯坦福、伯克利这个硅谷的是在旁边的两家大学,都是有很多陌生 learning 的。我觉得东海电影也是有,但是东海岸的传统派可能更加的根深蒂固一些。就是从最早的这个派系发展,当然就是现在的卡莱基梅隆和 MIT 这两所学校。他们有很多传统派的学者,也有很多新兴的学者,大概就是最近五年招招过去的。还有一个比较好玩的事情是大家不管在哪儿做,好像最近这两年都是在往硅谷这个地方跑。我有很多朋友啊,不管是在波士顿那边创业,或者说在那边当教授,他们很多人也在其他的公司领了一些职位,而且这公司的办公室都在硅谷。

01:25:52 1

从一个边缘学派到一个现在更主流的学派。作为 machine learning,我能理解大家都在往这边聚拢。那都还那个传统派别他们已经认为信仰应该发生转变了,还是说我还坚持自己的信仰。

01:26:06 2

我觉得有两点,一点就是我觉得很多人都在积极的拥抱和探索。就是相当于你本来有一个工具箱可以做很多事情,现在别人告诉你他们也有一套工具箱,而且很很激动的一个工具箱,你不一定就是。赞同他们说的,就是这工具箱有什么激动。然后现在你可能看到一些东西以后,你是愿意去转变,说这个工具箱可能很激动,我们怎么把它探索实验起来。你有可能是做结合,也有可能换方向,也有可能就是你又开放了一个新的方向。我觉得这个是时时刻刻都在发生的。

01:26:36 2

然后另外一边的话,我觉得传统派的人,其实他们我觉得是有非常多的这种专家的洞察的。因为很多传统派的人为了把他们的任务做好,都是经历过非常多的硬件转换,或者说这些不同的工程的提炼。他们如果能够在很多现有的项目中分享一些见解的话,我觉得他们讲的都非常有道理。比如说做昨天晚上其实我还正在读一个博客,博客上面就在说了这些电机的一些问题。然后这个博客的作者也在末尾也感他是一个搞机器学习出身的,然后在研究电机。然后他也感谢了很多传统派的一些教授,在 CM 的教授对他的一些指导。

01:27:18 1

你看硅谷现在还有很多新的公司。刚才你说了 skilled 和 pie,这是两家在硅谷创业做机器人大脑的公司创业公司。然后还有另外一些创业公司,比如说 figure,比如说 one x 比如说 dinner。能不能讲讲他们的创始人的来历,然后以及他们分属于哪些派别。

01:27:35 2

他们的由来我只能分享一下,就我理解到的一些接触到的一些事情。我感觉像派和 skill 的两家都是有比较的浓厚的学术人创业的这个标签。因为两家的创始人和联创都是在学校当教授,而且有些是比较高产的教授。两家的口号也是有些类似,都是想做具身智能的一个通用的大模型的大脑。

01:28:04 2

然后在区别上来说,其实一方面我觉得在应用上面派更多考虑是一个双臂操纵,还是想把操纵这么一个问题给解决。因为可能我觉得在派加入的学者或多或少都觉得之前在移动方面取得了很多很好的成果。我们现在应该想想怎么样在拿东西,放东西这个方面取得很好成果。因为你可以暴论,暴论就是你如果能把 pick place 这么一个拿放的问题解决,你可以把整个生活中所有的家务都干掉。你不就是抓放,然后你可以抓这个东西,放那个东西,或者有一些路径轨迹的限制。但是这是一个大类非常值得解决的问题。另外一方面我觉得在 scale 的话,相对而言他们有一些更多的就是腿人形和狗的一些探索。我觉得这个是相对而言更多的他们的。

01:28:54 1

构型更完整一些。

01:28:56 2

这倒不一定,因为现在人形机器人如何装操作空隙,其实是没有解决的一个问题。他们有很多就是他们现在能看到视频里的话,相对而言他们的操纵的这个任务都比较简单。然后他们更多的强调一个移动性,我觉得并没有完整,因为现在我觉得并没有 converge 统 1 到 1 个好的一种构型。它又能做很好的移动,又能做很好的操控,所以大家各有侧重。

01:29:26 2

然后其他的公司的话我觉得就不得不提一提,很早之前就在做人形的公司。我觉得其实特斯拉在 2021 还是 2022 年的这些伊隆马斯克的一些话语,肯定是激励到了不少人。就是让大家当时的一些印度人就已经开始有这个热潮去做人心。然后 figure 的话是应该是 2022 年开创的一家人形机器人公司。然后他的 founder 就我所知的话并没有一个技术背景。他是有之前成功创业的一些经历,我觉得是很有意思的一个人。因为他能在 2022 这时间点做一个他都不是那么熟悉的一个新的领域,让他相信这个,我觉得这是非常有意思的一件事情。

01:30:07 2

然后相对而言,one x 的话我听说是创始人其实是深耕了这个机器人的这种电机。因为他们是做省区的人形机器人,比较独特。然后戴娜的话它的创始人是因为这个戴娜创始人他是相当于是认识他们是有一些创业的背景,也有一些技术的背景。我觉得如果用一个标签去形容他们的话,可能他们是更强调商业部署落地的。当然我觉得一个具体场景。

01:30:38 1

比如说我们都看过他那个叠衣服的场景。

01:30:41 2

对,就比如说我觉得如果看看他们在 2024、2 0525 年期间所发表出来一些东西的话,可以形容为有没有可能机器学习已经可以竞价落地并创造一些商业价值。同时这个商业价值可能能给他们带来一些部署上的优势。以后随着这个机器人大模型的能力越来越上,可能大家也会慢慢的从这研究端转到部署端。可能他们就是做部署端比较早的一类,然后其他的其实也有。因为当时我觉得是 2023 年到 2015 年是井喷式的机器人创业。就不得不提 2023 年初的这个黄埔军校,机器人的黄埔军校应该还是谷歌的这个研究所。因为当时确实时间点非常有意思。

01:31:26 2

2021 还是 2022 年,ChatGPT 出来了,效果太好了。其实动摇了很多人的这个想法,使得当时做什么东西这个课题是有很大的一个变化的。然后包括谷歌当时也是做了一个比较大的动作,就是把他们的机器人的部门给变相的削减了一下。就是为了给他们做大模型,可能抽一点人过去,但这个其实也蛮影响大家做机器人的研究,所以很多人就趁这个机会出来创业了。派的连续派的创始人都是在谷歌之前做的那 scale 的话其实他们俩创始人之间在 meta 是有研究员的职位的。然后 figure one x 应该也吸纳了不少从这一波里面出来的人。

01:32:08 2

然后还有比较值得关注的,当时还有两家公司也是从这一波里面出来,一个是叫 generalist AI,一个叫 sunday robotics。这两家公司的一个比较共通的点是他们都相对其他公司更多强调了用优米作为数据采集的一个手段。优比的话是是这两家公司的创始人。其实当年是在一个 paper 上,这个 paper 就是 humic paper。他就说了我们可以做一些设计好的一个爪子,人就可以抓着这个爪子去自己生活的这个世界里面采集各种各样的数据。然后并且证明了这个爪子收到的数据是可以迁移到一个机器人的一个上面的。所以他们两家公司不约而同的都相比其他公司更加重视这方方面的发展。

01:33:01 2

然后我觉得可能 generous 的 AI 就会稍微偏重工业化场景应用一点。这是从他们发放的视频里推测的。然后可能相对的话他们发的视频就更多的有一些家用的场景体现,甚至包括他们的这机器人也比较可爱的,目前是看到比较可爱的机器人。

01:33:20 1

后面这几家公司我们能理解是做硬件的公司吗?因为你们那两家是大脑公司,还有。

01:33:27 2

google.

01:33:28 1

特斯拉也是大脑公司,对吧?

01:33:30 2

我觉得特特斯拉我。

01:33:31 1

估计他的硬件也不错。

01:33:33 2

创业是一直在变的,所以很难用今天的思维去想明天的事。但就现在这个快照来看的话,派肯定是更加注重大脑。我相信 skilled 也注重大脑,但是 skilled 大家创业公司其实都比较神秘,也不知道他具体做什么。O 开始。

01:33:49 2

然后特斯拉的话,大家一般谈起来都会认为它的硬件是很强的,毕竟他有这么多的钱去烧。就机器人硬件的研发不是一个很容易就能上手,不像软件,我觉得软件其实相比而言,反而是容易上手的一个东西。硬件的话它的产业链,它的这个就是迭代速度,包括它里面的工程师,我觉得这个都不是一天而起的。特斯拉之前有造车的经历,造机器人方面大家都觉得它肯定是有优势的。Figure 也是一个造机器人,figure one x 都是造人形机器人。可能区别就是 figure 用的是啊我们电机 RYX 用的是这种省去的方式。

01:34:24 2

Generous 和 sunday 的话,我相信其实现在包括设计灾难,大家可能或多少都会开始设计,就是如何弄一个更好的硬件出来。但是你说造硬件到什么地步,可能没有一个能看得清的一个说法。之前不是有一个笑话,就是如果你是一个认认真真真的想把事情干成的机器学习的一个学者的话,你真得找自己的硬件。因为市面上没有一家是真的拿来就能用,完美符合了你所想要的应用场景。

01:34:58 1

软硬的一体。

01:34:59 2

软硬一体我不知道,但硬件其实本身都没有达到这个地方。

01:35:06 1

硬件我们等会儿也会着重来聊到。

01:35:10 2

其实我觉得硬件有一个我的很简单的构想,就是到底有哪家公司能给我一台,我可以把它放到人家里去,我就有一个人在后面遥控他,但他真的能把我家里我想做的事情都做到,而且它不坏,它很稳定。我觉得如果能到这一步才是算我觉得硬件第一个版本才是真正出来的。

01:35:28 1

因为我记得你上次跟我聊还聊了好多,比如说花衬衫。

01:35:34 2

Oh my god, 这是一个好好玩的梗。这个是波士顿动力的创始人 mark.

01:35:39 1

他在我脑子变成了一些二次元的画像,over 就是你们机器人行业的各个人物。

01:35:44 2

对他其实是一个非常有个性的人。他现在你去人家见到他的话,他就是一个白发老头穿这个花衬衫。他其实一直在公共场合都是以花衬衫的形象出现,包括他给波士顿动力后面的 AI 研究所设计的这个队服,都是一个夏威夷花衬衫。这个来源其实是他在年轻的时候,据说谣传在当时那个年代做研究交流还是一个比较严肃。正经就是不可有丝毫懈怠的事情。所以当时他这个人的穿着一个衬衫什么的,还是一个反正不太那么严肃的一个衣服去参加这个会议,就被别人讲了,就别人说了你怎么可以穿这样的一个东西,有点不太尊重。然后他从此以后我就要穿这个,而且要推广,然后大家都可以穿这个。所以他现在的形象就是我觉得他是有一个叛逆精神在身上的。

01:36:35 1

是不是还有一个非常飘逸的 ub enough.

01:36:38 2

刚才好像已经讲到了一些,就是阿比的他思想非常的天马行空,他其实对他其实有影响。也有华人的学者是他的学生,现在也成为了比较知名的教授。王小龙他现在在 UCSD 做教授,他是阿比 B 的学生。阿比的当时是挺有意思,他做的事情就是感觉打一枪,然后你还没明白这枪是什么意思。后面他发现还真的有点意思,他就是一个天马行空的,就是你跟他开会的时候都不知道他下一句会说什么的。

01:37:06 1

这么一个人会说什么让人很出乎意料的吗?对。

01:37:09 2

他的思维就像是一个点的一个。

01:37:12 1

跳跃性的思维。这里面你有最崇拜。

01:37:15 2

的一个学者吗?我觉得我能够欣赏大家的优点,但是我还是比较崇拜什么游戏创作者,小说写作人。这个只是生活和工作分开。哪个是生活?

01:37:30 1

我觉得。

01:37:31 2

人文故事是生活。

01:37:33 1

对工作是一种优化。

01:37:35 2

是一种很纯粹的把大家的好给吸纳在一起的这种态度。

01:37:41 1

你平时会跟比如说大模型的研究员有一些接触吗?你会觉得机器人的里面的人和大模型的人会有什么不一样?

01:37:50 2

我觉得接触是肯定要接触的,我也能越来越多的感受到。确实要想把机器人做成,是得在一个团队的环境里,是得吸纳大家的所长,有各行各业的人加入才能把它做成功。而不同之处的话,我觉得就比如说就这么讲,我们有个机器人,它收了一条数据,大模型的人可能就会想说,咱们说个 100 万条这样的数据怎么样?然后我们就可以拿到一个数字,然后有这个数字以后,我们就会让这个数字变得越来越好。然后作为一个更多搞传统机器人出身的人,我们可能会先想的就是这条数据长什么样。我要来看一看他的这个动作,他做这个东西,甚至包括他当时的硬件条件,硬件环境的这些设计。就是你能看到就是相对而言,我觉得做传统机器人出身机器学习的学者会更多的在意这种物理的动作。而大模型出身的学者,他们经常会比较飘逸的说,现在这个信息好像不够全,他们想要加一条进去或者补一条进去。我觉得这个可能是你做很多次机器人,你会习惯了现在机器人的一些感知的一些系统。而大模型的人可能更多能跳出这个框框架去思考我们现在要什么样一个信息。

01:39:03 1

想把这件事情做成。我们刚才说了很多创业公司,其实硅谷的大厂做机器人也很值得关注。比如说 NVIDIA,比如说 google,是的,还有 tesla,他们的 batt 有什么不一样吗?我们其实刚才顺着把每一个机器人公司的 batt 都有讲一遍。

01:39:21 2

Bat 我觉得我不能替别人公司讲,我只能讲讲我自己的 bat 但是从你能观察到的公开信息来说,我觉得特斯拉是专家人性,他应该是人行港最激进的一家公司。因为就拿最简单的事情来举例,手这个事情,我在我有我的相信,我现在觉得手是一个有了会非常好,但现阶段没有也没有关系,不是必要的。但特斯拉他就更加的强调说,我们要搞一个终极形态,我们一定要把这个机器人的方方面面做的都很人性上的,他们是有很强烈的一个人形的一个信仰的。而谷歌我觉得他们因为有自己的大模型界面带前面耐他们做的比较成功的。比如说有多模态能力。前面奈的多模态能力,比如说图像生成和图像修改,是现在大家都比较津津乐道,也会在日常中使用的。可能对他们来说,机器人也可以是这个模态的一部分,会给他这个模态提供一些空间感知,空间规划或者空间控制的一个能力。所以我觉得他们在也许我猜的他们在走机器人路径的时候,是更多是想着说机器人如何成为这个多模态大模型的一个部分。

01:40:27 2

而英伟达的话,江湖的笑话就是英伟达做所有事情都是为了外卡,所以他们有很多需要烧很多卡才能完成的一些项目,比如说像世界模型这样的项目。但是通过过往的经历一次又一次的证明,有些时候真的就是数据多了,卡多了,效果就上去了。所以大家也很期待他们这样做能做出什么。就是可能一些计算力更大的一些更加简单粗暴也是一种美。我觉得但是其实做的时候,可能每个学者也要发挥自己的一种设计的长处。

01:40:58 1

在英伟达做研究会不会。

01:41:00 2

卡更充裕,我当然。

01:41:02 1

是这么猜的了。OK 在这种不同的重心和选择之下,每个公司他的不同的软硬件方案是什么样的?

01:41:11 2

我觉得硬件方案大家多少不会那么公开的讲,你只能从他的视频里推测。

01:41:17 1

为什么这个是更保密的。

01:41:20 2

我觉得硬件其实我也不知道,但确实大家在公司工作或多或少都得遵循公司的一些保密原则。

01:41:29 1

硬件是不更保密的。

01:41:30 2

我觉得软件其实也很保密派,应该算是一个比较独特的地方。就是在这里我们还是有一些学术界的影响,觉得要大众文章发表,也是你研究的一个部分。其他公司的话就我目前的感知觉得没有这么的开放,甚至包括派的办公室也没有那么严的安保。有的时候就可以带一些同行的朋友去看一看,跟大家介绍一下,就这种思想的碰撞。其他的公司我觉得就是在硬件上,我觉得人形和非人形可能是一个比较直观的一个 bat,比如说像特斯拉 figure one x 都是比较强烈的在 bat 人形的。但是你说他们做的和其他人做的一个最大不同,可能就是有没有这个腿是一个,然后也有人认为是就是你有了腿,因为你是个人形,而我们这个世界是为人而设计的对,所以你做出了人形机器人后,它在这个世界里一定是最自然的。

01:42:29 1

通用性更好。

01:42:30 2

对,通用性更好,这是一些人的信仰。然后另外一些就是非人性的信仰,我觉得其实可以分为两派,实用派还有狂野派。

01:42:38 1

你们是哪个?

01:42:39 2

我个人是实用派加狂野派。因为可以展开说一下。就是实用派的话其实我们会觉得这个机器人不一定非要是人形它就能做很多事情了,对吧?而且人形的机器人的很多问题,也许别人可以解决,我们可以后面再跟上。

01:42:58 2

我们现在觉得最近现阶段最重要的问题之一就是他的能力、他的表现、他的操控性的这个东西,他不需要一个人性他就可以做。而且甚至如果你做得好的话,你已经可以去做这件事情了。在现实生活中去部署,做一些。所以我们对人情在实用的角度上来觉得,在现阶段没有那么的有必要。而狂野派这就海了去了。

01:43:22 2

你看我们这么多年有车这个东西,车是有轮子的,自然界中其实没有这么一个东西。但其实现在车上或者大街上,或者全世界那么多条公路,都是为了让车能跑得更好而设计的。就可能有一种信仰是说,如果真的是一个有用的一种形态的话,大家将来会为了这个形态去改变你所生在的生存的这个环境。比如说适配,我觉得这个是可以成立的。并且狂野派他们为什么要有两只手?四只手好不好?三只手好不好?或者说你下面这个轮子,你好多轮子都可以,它可以充分发挥想象去想,有没有可能有一种生物的自然界的演化链出不来的一个形态,它其实是最好的一个形态。

01:44:06 2

然后你这个形态做了以后,因为机器人它是可以换的,你的手坏了可以换。我个人比较相信,也许就是一个成熟的机器人的形态,就是它的动态组装性。就有可能将来的机器它就随时随地都可以把自己的身体的一个部件给换掉,换成一个更适合的东西。

01:44:22 1

就像他的工具一样。对,所以你的实用派加狂野派是怎么回事?你想象中的构型应该是什么样?

01:44:30 2

现在想不了太多,现在就想把现在这个构型表现做好。

01:44:34 1

因为派是要追求做通用大脑。对,那直觉来看要做通用大脑,它就应该适配一个更通用的构型,而人好像就是那个最通用的构型。因为你也刚才也说了,就是现实世界各个东西都是为人来设计的那为什么你们要选择是既要做一个通用大脑,又不选择一个人形呢?

01:44:53 2

我觉得通用大脑的通用大家可能有不同的诠释,做一个具体的构型的通用功能是通用的一种做法,而做很多构型都可以受益的一个大脑是另外一种做法。而且也没有人说就是你做很多构型都能受益的大脑,它就不能在人性上面做。只是你们。

01:45:19 1

希望你们需要覆盖的构型更广阔。

01:45:23 2

就不只是人。没错,就是派的模型都是在不同形态的数据上面训练,并且可以在不同形态的机器人上面使用。只是现在可能能看到的只是这么几个具体的构型,但其实没有放弃,就是说这个大脑得在不同的机器上面都能用起来。因为这个人操纵的道理是一样,就是我作为一个人类,我去要操纵一个机械,我不管是开车开挖掘机,或者是去去操纵这个腿怎么踢,或者说一个机械手它怎么去做这件事情,我都是由一个我的大脑去。操作这么多不同的构型,我觉得这个才是通用大脑最本质的一个定义。而不是说就是我去做了一个人形的大脑,它就是通用大脑。那是不是。

01:46:09 1

比如说做一个人形,在这个构形之下做一个通用大脑,人形的相对任务是更复杂的。你做完这个复杂任务,你可以泛化到其他的形态更容易?

01:46:20 2

我觉得任务的复杂性是可以抽开好几个层面的。比如说人形它因为关节多,所以你要同时控制这么多关节是有一些难度。但是你做的具体的任务,任务的难度我觉得和人情是可以完全不相关的。

01:46:34 2

就像我之前说的,我们其实非常相信一个任务。比如说就假设你要组装这个麦克风,这个步骤应该很多,你用人形来做,你用一个更加简单的双倍机器人来做,它都是完成一个很难的任务。我觉得在现阶段,对我个人来说,完成这个很难的任务比你有什么构型更重要。甚至我个人觉得你用简单的构型做出了一个更复杂的任务的话,将来你再去控是人心,做这个应该会更简单。因为你更复杂的构型可以提供的功能可能是更多的。它的操控虽然难,但它的这个灵活度就确实是有些关节上灵活度的东西,它可能更简单。所以如果我能用一个简单的构型去做成一个非常复杂的任务,我觉得他将来能够迁移到人性的概率也是非常大。

01:47:19 1

而像比如说 skilled,它做的通用大脑是要匹配一个通用的人形,对吗?其实我们。

01:47:26 2

并不理解它这么多的技术细节,只能是从他的视频里推测。我觉得他们有很多就是因为他们可能更相对而言更靠近商业部署一侧,所以他们有一些移动的需求。他们可能现阶段就已经开始做了一些人性和狗的这个东西。你看派其实我们也有一些就最近的一些发布是说了就是派有一些 partner,就是有一些合作伙伴的机器人公司。包括之前一直也一直没有停止过帮助合作伙伴的这些机器人,不管是不是人形还是什么其他的形态,用上我们的这个大模型去做一些事情。

01:48:07 1

因为现在我们管这些组织都叫 frontier land。那你能不能讲讲在机器人领域,你觉得机器人的 frontier lab 的 frontier 体现在哪里?哪些指标能够来描述这个 frontier?

01:48:21 2

我觉得前言 frontier 方方面面,咱们要走的路还挺长的。我觉得其中一个比较切身感受的是这个 evaluation,就是评估这个问题其实我。

01:48:33 1

觉得 NLP 是走过这条路。

01:48:35 2

自然语言他们当年就是生成了一段话,叫你来给他打分,你怎么打分也是一个不容易的事情。但是在机器人这边更加糟糕的一点就是你还得在机器人上跑,你才能知道他做了一个什么事儿,你才能给他打分。不光这个分有点难打,而且你还得受到机械物理的限制。很多时候只是一些变化什么的,可能你自己不知道,然后它就会影响你的这个模型表现。我相信在最终的成品那个阶段,应该是不太怕这些细微的改变,或者说一些比如说你要拿这个杯子,对不对?假设我们现在做这个任务就是拿这个杯子,你把杯子放在这个桌子的任何一个地方,是一种扰乱他的一种方法,就是看它是不是每个地方都拿起来。你还要看这个不同的光照,你要看不同的背景,你还要看这个桌子高度,甚至可能不是一个桌子,而是一个柱子杵着的,你能不能拿起来,或者这个杯子还有自己的角度。就是有这些无穷尽的一些初始条件,很有可能都会影响到你最终的表现。

01:49:39 2

所以你在评估的过程中,你是希望能够把这些东西都给评估出来。但现实生活中,你又就你又你又不一定能够那么的好的掌控。所以评估现在是一个问题。评估的问题就直接导致了你对前沿的一个认知,就不像其他的领域,它是有一个英雄榜一样的存在。

01:49:57 2

就是我们现在发了一个超级大的数据,每个模型都能在这上面跑一跑跑马场,看看哪个马赛马谁是第一名。你是能够比较主观,比较客观清晰地看到在这么一个事情上一个确定的结果。而在机器人谈论前沿比较难的一个原因就是因为这个评估太难了,导致你很难彻底的去评估它。就包括每一个公司,我相信内部都有一个评估的一套东西。可能这些东西就是你的注重点,他的注重点都不一定一样。但是退一步讲,我也觉得这个是暂时的,我觉得最后做出来的应该是不会太担心这个事情。可能现在大家还在探索怎么样做的更加的鲁邦和宽泛。

01:50:36 1

所以现在这个 front 还是很难定义的。

01:50:40 2

我觉得可以看到一些算法的表现,怎么说呢?可能是就是一个最核心的部分,大家都看得见。然后随着他向着更前沿的方向迈进以后,就变得越来越有些乱。就需要你能从纷乱中找到一个清晰的线,然后你相信让你把这个图给夯实,夯实了以后,可能大家都有了一个共识,这样的话才会知道,这是一个比较确定的东西。就有一种被动,就感觉特别前沿的东西你都没有办法去定义。因为不好说就是谁谁谁在那个保单上面跑到了多少,因为这个是所以这个是前沿就没有。

01:51:17 1

这种东西来依据。所以现在其实大家的方向是分散的,就是都在朝不同的方向在发展。不知道哪一条线是那条大道,大家还没有统一到那条大道上去。

01:51:29 2

我觉得确实在研究的角度看,问题的角度,想要做的任务上来说,是分散且百花齐放的。但我觉得在宏观上面来说,其实每个人的命题都是类似的。如何让一个机械的整体,它在现实生活中做一个任务或者做很多任务他的表现好。只是你这么宏大的一个命题,得有一个抓手开始做。每个人选的抓手可能不太一样。

01:51:59 1

我们绝大部分人都没有机会去看过一个机器人的完整的产线。那么从你的内部视角给我们讲讲一台机器人是怎么诞生的。

01:52:08 2

机器人是怎么诞生的?我觉得这个命题可以还甚至可以讲到原子级别。但是我这个人的工作的范围也是比较有限,我就从我认知的范围里讲一讲,就是如果一个电机已经被制造出来了,那么我要做的事情其实就是因为电机它就是一个会动的一个关节,可以这么理解,这个会动的关节,你就把它连在一起,它就成了一条机械臂。

01:52:34 2

你看你人的手臂其实是有非常多的关节和更多细小的肌肉。而现在的机器人的这个形态就是几个比较大的关节,可能比较流行的就是六个关节或者七个关节组成了一条手臂。然后这条手臂就可能就差不多是按照你人的活动方式来对照的。因为机械手基本都会有一个大的一个肘关节,然后会有一个腕关节,然后包括有个肩关节,这个都是比较通用的。你就把关节放在他想要的位置,然后做一些 3D 打印件,或者金属件,或者磨成你想要的形状,把它们固定的组装起来。这样每个关节动的时候,剩下的就会跟着动,这就成了一条非常原始的机械臂。

01:53:11 2

在机械臂能够组装到一起以后,你其实要为他写一些系统和驱动的东西。比如说最低层次的话,其实都是通电或者气压。就是你给他发了一个什么信号,然后他就会收到这个信号,就会开始做一些动作。

01:53:28 2

然后很平常的一种操控手段,就是用一个位置操控。是我希望这个关节现在是一个什么 90 度角,把它变成一个 180 度角,我就会发送这个。它需要在关节的层面,把上层发给它的这个讯号转换成一个它能够真正执行的这个东西,这个就是叫底层控制。然后再往上一层,你怎么决定你要发什么样的这个位置信号?这个可很有可能就是需要你有一个大脑看到当前的这个任务,然后决定为了做这个任务,我要在桌子上拿一个东西,我得先把手抬起来。他是要需要理解这个人物,然后理解你的这个关节,然后去做一个把这个肘关节往上抬的这么一个决策,再发给机械的这个关节。

01:54:09 2

在关节在执行实行了以后,就有新的一个场景了。新的场景大家也看到,我现在已经在桌子上面了,我要做下面一个动作的话,可能就是往右往左。我觉得这个是一种两层式的一个思想。就是有一个大脑来做一些决策,做成了一个你能听得懂,能执行,然后也能够比较方便我们去做一些调试的一个东西。然后同时他有一个更底层的东西,去把它翻译成一个物理世界更。

01:54:39 1

原始的一个东西。那接下来我们来讲讲派的工作和你在派的工作。你刚才讲到机器人公司,其实现在各个公司的主线和抓手是不一样的。你们先纵览一下派的主线和抓手是什么。

01:54:56 2

好的,我觉得要了解派的工作,可能一个比较好的方法是看派的几篇就是主线发表。之所以是主线发表,是因为我们觉得主线发表的这个命题是可以推动整个领域往前进的。其中有三篇主线发表,现在第一篇是派林,它的关键词应该就是能力。第二篇是派 0.5,它的关键词是泛化。然后最近的这篇是派 0.6 星,它的关键词是表现就是在派林刚开始做的时候,我觉得是大家都非常的激动可以用。有了一个非常好的架构,然后可以用一个大模型的思路去做机器人。但没人能知道做成什么样,也不知道能做成什么事儿。当时在 2024 年初派创立,就想做一些之前做不到的事情,但是具体要把这些就做不到的事情给做出来,就是派零的这种旅程。

01:55:56 2

因为其实派零做了三个任务。第一个是大家可能比较熟悉的,就是叠衣服。我觉得我们应该是在 2024 年发表。2024 年 11 月的叠衣服是一个让人比较耳目一新,就之前从来没有看到过这种级别的这个任务的表现。然后第二个是叠箱子,叠箱子叠纸盒子也是一个。这个东西真的能做吗?我们不知道,我们来做一做看。然后当时还有这当时还有第三个,就是把去桌子上去抓拿放,但是你需要前所未有的这个物体的多样性,却都能够处理的很好。所以这三个任务当时是奠定了我觉得是奠定了大模型能在这些前面想都不敢想的任务上表现成什么样的一个基石,所以注重的是表现。

01:56:45 2

然后第二个任务派 0.5 是泛化。泛化的意义其实我觉得至今也是存在的。就是如果你大模型训练出来以后,一个机器学习的根本问题也就是这个所谓的 in demand 和 out of domain,就是你是一个数据内的和数据外的。如果你训练好了以后,只能在数据内的这个范围里表现得好打到数据库里面就没有用的话,那你这个影响不就很有限。所以就很强调这个泛化。就假设你做了一个任务,他是在这个房子 A 里面收集的,你把它放到一个房子 B 好了,房子 C 或者说你要探索就是你要多少个房子,100 个房子、1000 个房子。你在这些房子里都收好数据以后,你才能在第 10001 个房子里面得到一个很好的效果。

01:57:30 2

所以派 0.5 的出身我觉得是想要探索我们的大模型能不能够泛化,并且泛化的一些条件是什么。同时当时因为派零和派 0.5 之间也是有一些其他的发表,可以我们等会儿再说一下,就提升了大模型的一些表达能力和分层能力,使得它能够实现这样的一个泛化。所以当时我们是在很多 LBNB 里面收集了数据到这些别人的家里。这个因为是走出去了,就不是我们控制的一个公司的一个场景。我不是谁控制的一个工厂的场景,而是真的就是杂乱无章的别人的家里面去做了一些日常的任务。做了这么一个数据收集并且研究。就有了这些数据以后,到新的家里表现会是什么样。

01:58:14 2

当时一个比较令人振奋的一个点,其实是大概收了,应该我记得 paper 里写的应该是有 100 个家。然后再你再试试把这里面的这些家给去掉,你看你去到什么地步,它还有增长。就是我们感觉这个曲线是放缓的。就是可能你不需要真的在世界上所有人的家里面都输入数据以后,才能在他们家里面干活。你其实是有一个数字儿,你可能收到那个以后就可以了。我们觉得这个是泛化比较令人振奋的就是你 in distribution 这个数据内是有一个尺寸的,达到这个尺寸其实或许就够了。

01:58:47 1

派 0.5 的标题好像很有趣,叫开放世界泛化模型。是的,这是 survey polish 过的标题吗?

01:58:55 2

标题其实大家我怎么觉得乔西是出了这个标题好像超出。对,但是每一篇 favor 你看应该都有一个科幻小说的一个引用,这都是四月写的。

01:59:06 1

派零和派 0.5 是什么?

01:59:08 2

派林和派林给我的科幻小说的引用,我不记得这个只有四个知道。然后后面到了派 0.6,这也是一个我觉得我们 feel 的需要回答的问题。表现就是又回到之前的这种,如果你做什么东西都可以,但做什么东西都比较半吊子,那么这个模型的用处究竟是什么?所以派 0.6 的出现其实就是想回答,假设我们现在真的想做一件事情,就把想把它做好,我们到底怎么样把它做好,随时提升这个表现。而且他 0.6,我觉得这也是就是我参与非常高的一个项目。

01:59:43 2

因为我是强化学习的团队,这个是我们的第一篇工作发表出来,强调了很多的方法上的简洁性。但是在最后的表现上更多的是强调如果有一个智能体,它差不多可以在一个任务上做了的话,你就去收集他的体验数据。让他在真实世界中去收集他的体验,把这个数据放回他的训练池中,它其实可以达到比之前比你之前的那些固定数据更好的效果。我觉得它对于我们数据收集是有相当大的启示意义。

02:00:18 1

什么叫体验数据?

02:00:19 2

就是他自己去做的这件事情收到的数据,也就是平时我们说这个真机数据的时候,是有一个手臂。比如说我这样一个手臂,我就给你看在这个桌子上面,我简单就可以通过咬操纵就让他干一些事情。你收到数据,其实是就是这么一个机器绑在这个桌子上,然后做了一个任务,他其实可以不要操作,他可以让他自己去做做了以后他可以把这些数据都收集起来,就是数据的来源其实可以很宽泛。我觉得之前其实很多人会说,就是我们机器人领域都靠人来要操纵的话,这个数据收集又慢又不好。我觉得是可以再提升一点,但确实是有这么一个隐患,就是以后可能不能够完全通过这种方式收到所有想要的数据。

02:01:02 2

我觉得经过派 06 这片项目以后,我们也有了很大的感触,觉得机器人自己的数据也会可以非常的强。因为它的起点是人给他设置的。但是如果要超越这个起点,还是得机器人在环境中去动作。包括我个人是比较 bullish,就是比较暴论的。坚信将来机器人的价格应该又便宜,然后又方便。很有可能就是很多人现在对于数据的一些担忧,在时间的长河里其实都不重要。因为你可以让机器人这么多的机器人在部署的过程中收到数据都拿来为我所用。

02:01:41 1

是吗?派 06 是 1 个.

02:01:43 2

基础模型,这个星号的意思是你把最后的那个成品,就是你的这些数据放回了你的模型之中。

02:01:52 1

但是贞集收集数据。

02:01:54 2

不是说很贵吗?如果如果你可以自己叫 roll out,你不就相对便宜了吗?就是真机数据贵,我觉得分为好几个方面,对不对?一个是你首先有一个真机平台,然后你要把这升级平台放在人家家里,你还要维护这个升级平台。同时你还要会用一个人让这个人来做一些任务,同时还要跟这个人做交流,还要做一些规划。就是一个非常复杂的一个管理的一个问题。但我觉得如果机械的价格降下来的话,就在这个过程中,我个人认为现在的比较大的大头其实是管这个人去收到你想要的这个数据。但如果你可以把数据的操纵员给放在一边,而是换上你已经训好的一个大模型,让大模型在这里跑,其实你数据出的成本应该是能降很多。

02:02:42 1

硬件也需要降低成本吗?

02:02:44 2

硬件我觉得永远都是可以再便宜一点,然后就便宜就对了。现在比起五年前肯定是便宜了很多。

02:02:51 1

的对关于数据我也听说就是错误数据,其实是好数据,就是错误之后再纠错的数据。

02:02:58 2

我觉得这个是动作的一部分,是踏实的一部分。这个思想其实是大概是在最早的这个模仿学习里,就有很多模仿学习的一个很严重的问题,就是积累的错误。就可能每一步骤的微小错误不断的放大以后,会让机器人到达一个他完全没想过的一个非常糟糕的情况。就是人说起数据中不会碰到的情况。而一旦机器人进入到这个情况以后,他有可能就不知道该怎么样修正它的路线,去完成这个任务。

02:03:31 2

这个技术问题是有一整套的修复方法的。因此很多人说出去的时候都会很强调说我们不光要收一个完美的人的数据,同时也要收很多就机器人进入到了一个不好的情况以后,怎么样修复,怎么样继续去完成这个任务。那种修正数据确实修正数据对于一个机器大模型的表现很重要。但是再次强调就是修正数据也可以通过机器人自己跑来说,这就是强化学习的一个比较本质性的东西。

02:04:00 1

现在机器领域关于数据问题,大家有人相信真机数据,有人相信仿真数据。你持有哪一派观点?

02:04:07 2

黑猫白猫抓到老鼠就是好吗?什么数据真的好用就相信谁,而且是一个 practically 的好用。就比如说最本源我是相信真机数据的,但确实我们要承认真机数据的价格在现在这个阶段比较数据要贵。但是如果你用就假设你有个 budget,你有一个十万美金,你用这个你用这十万美金收多少真机数据,你用这个 10 万美金收了多少?就是仿真器数据可能数字的量是不一样,因为巴结是固定的,数字量是不一样。但是另外一方面就是数据的质量,数据的意义,数据谁能够让你这个模型做得更好。我个人觉得如果你只有仿真数据的话,你应该不太好做。有一些任务如果你因为他没有。

02:04:49 1

数 to seem to read up.

02:04:51 2

我觉得不光 simply to real cap 甚至 similar 的场景很难的。比如说你要用仿真去做一个叠衣服的仿真,这应该是依然是一个半前沿问题。半前沿是因为我现在没有看到一家能够做的非常好,就是谁在仿真器里面做好这个训练以后。加一点点政绩数据就能让他表现很好。我觉得现在不在这个地方。但是也有一些人认为这是可以达成的,所以他们在积极推动这种前沿,所以是一个半前沿。就是谁谁谁也不清楚会不会两三年里有人做了,真的把它做通了,它可能就是一个非常强有力的一个说出去的一种方法。

02:05:27 2

但现在 2026 年的快照,你要是想做一些跟软性柔性衣服摩擦力,还有这些就是年就是维 salty,就是这种物理性质非常复杂的东西。你在仿真器里面,其实你可能都没法搞出这么一个仿真器来。所以你都没法说这个数据就是我觉得是要非常强调 particular,就是你到底能收到什么样的数据去思考,而不是只看我们有 1000 万个小时的数据,我们怎么样。很有可能你这 1000 万小时数据都是 garbage 垃圾数据。

02:05:56 1

那就没有什么用的。对于叠衣服这个场景是不是真技术就更好用,那它是可以采集的,就是你说的体验数据。

02:06:03 2

我觉得现在相对而言,叠衣服最简单粗暴,就是采征集数据,甚至包括你看到我们都有开源模型的,我们开源模型应该是也有一些给依附的能力在里头的。你也可以拿它去作为一个数据的起点,都是可以的。

02:06:17 1

但你要做的是一个通用大脑,而不是这样实现一个场景任务的。因为场景任务其实你做强化学习就可以了。然后你通过这采集帧集数据,而且这个场景是相对固定是有限的。

02:06:29 2

这是一套可行的流程,但它不是全部的。对,但是如果。

02:06:34 1

你的目标是一个通用的大脑,那你需要是和现实世界交互的,所有的非结构化的数据是你所需要的那如果当你需要的是一个这么大量这么丰富的数据的时候,那你应该 Better 的是真实数据,还是仿真数据,还是某种混合体。

02:06:52 2

我觉得大家的目标是一致的,是想做一个能在现实场景中能在很多不同的场景中做很多不同的任务,且表现都好的一个智能体。但是要做到这个智能体,真的需要所谓所有的数据。尤其有一些数据它的相关性是需要考证,是需要人去研究的。我觉得这个就是希望在一个美好的梦想世界里,肯定是所有数据都有用,所有数据都能有个最适合他的使用方法。但现在我觉得现状来看,征集数据目前我觉得是不太可取代的,尤其是你肯定能找到一些任务,它不需要真机数据,他就可以做的很好,这肯定是可以找到的。但是因为我们的目标,正是因为我的目标是要做的所有场景里的所有任务,所以我觉得目前整体数据还是不可取代的。

02:07:41 1

在场景上,为什么你们做派林的时候选择的是叠衣服、叠箱子这三个场景?

02:07:49 2

这个场景很酷。

02:07:50 1

真的这个场景具有可。

02:07:53 2

泛化性了。OK 当时像就是泛化性在派零这个时间段,更多的是有清理桌面这个任务来承担。因为泛化性的话,清理桌面的这些道具我们是有几百个,就是随便让他们去收,然后就换各种东西,就是发挥他们自己的出去的这些人自己的想象力去搞一些这个事情。然后当时我也参与了负责这边的一些策略的设计。

02:08:18 2

然后其他两个任务的话,首先是有泛化性的,因为泛化性它也不是一个单一的标准,它是有很多不同的细节。其中在叠衣服这个任务上,你看衣服它的状态是千千万万的,对不对?你这个衣服上多了一个锗,那边衣服拐了一下,这其实都是一个不同的状态。你收到的状态不管怎么样还是一个有限的数字,你没有办法去覆盖所有这些衣服可能的状态。但你如何保证你还是能把这个任务完成,其实已经开始需要一些泛化性了对吧?

02:08:45 2

然后其次就是你还有不同的衣服,对不对?这是一个红色的,那是一个绿色的,这些不同的衣服也是一种方法,甚至包括后期我们在做的这个派 06 星里面的这个更多衣服的叠,就开始叠不同种的衣服。他他是以另外一条泛化的一个标准,所以我不认为这些任务没有泛化性,只是他们探索的泛化性是不一样的一个东西。因为当时不知道他能做能不能做出来这些任务的一个原因,就是因为知道叠衣服可能会遇到各种各样你不在数据里的一个情况,说你能不能做好它。你可以这样想,就是前面这个衣服,不管它什么衣服,我第一步其实都是要摸到它。但是你怎么能保证你的模型做到这个事儿,你还是得上去你看一下它确实能够去开始跌。

02:09:33 1

你刚才也说到每个公司现在的评估都是不一样的。作为派来说,你们的评估是什么样的?哪些指标来评估你们,还确保你们在你们的主航道上。

02:09:43 2

我觉得指标又快又好,肯定是 abstractly 抽象的说就是我们的目标。但是评估要需要一个数字的话,你看派 06 星里面就提出了 put,就是固定时间内的成功的量。我觉得这个可能跟我现在的思想就比较相符,因为这就是我们提的就是希望你在做任务的时候,考虑到你到底花了多久时间去完成这个任务,这个任务完成度究竟是好不好。甚至包括其实也有一些更加细分的,就是一个任务的成功和失败的定义是是我们有打磨过。就是想因为你一个人在做任务,或者要一个机器人做任务过程中,你其实有很多隐含的含义。就到底怎么样去保证你最后的大模型能够完全的理解人的意思,我觉得也是一个开放性的一个研究的课题。就是他做任务这个事情,想办法做的这个任务。

02:10:36 2

而这个派 06 星里面的这个 through put 比较好玩的一点就是当时其实是一个是有个目标的,就是开箱之前是有这个目标,我们的研究员肯定是比不上我们的数据收集员在做这个任务上。因为数据收集员他们非常喜欢,非常习惯了用这个机器人。我们就问了,我们能不能做一个机器人,比这些数据员其实说的东西要快要好。最后我觉得是在起码在第一夫这个功用上是确实是 clearly 的达成了。最后这个机器人的表现是超越了他一开始的这个人,即使是最好的数据设计员的这个起点。

02:11:11 1

你觉得派的工作,其他工作还有什么值得讲的吗?派的研究其实是业界公认做得非常好的。

02:11:18 2

我觉得中间有一些研究也非常的有启发性。我觉得做研究这个事情,其实就是不停的前浪拍后浪,前浪死在沙滩上。但是你能够打一条浪出来还是很有启发性,可以为后浪做很多贡献。比如说派你看派零到派 0.5,中间是有两篇我觉得很有意思的工作放出来的。一篇是这个 fast,他是在研究了就是从一个大模型训练的角度上来说,你现在要去预测一个动作,怎么样表达这个动作,就是动作有没有一个很优化的表达空间。所以 faas 这边 paper 就提出了我们之前用的这些扩散模型 definition policy 的表达是这样的一种表达。但其实他可以去学一种表达动作的一个方法,然后发现如果大模型就是在这个空间里做预测的话,它会有一些性能上的提升和一些方法性的保证,所以这种也是一个非常重要的一种技术性研究。

02:12:15 2

然后另外一篇 paper 当时是叫做 hi Robert,就是想的是人和这个机器人的交互。就是人可能会说一个语言去让机器人去完成。但机器人如果只是一条到头就彻底端到端的话,很有可能在一个长达十分钟的任务里,它会有些迷失,他不知道现在该干什么。所以海螺宝第一次开始非常正式的说这个应该是一个分层的,就是有一个比较高层次的 policy。他会去把你说的这个任务转换成一个更加具体的,可执行的更短一些的小任务,然后再用比较低层次的执行端,他们俩其实都是在同一个模型里,但是给这个模型进行了一个输出分层。

02:13:00 1

然后在派。

02:13:01 2

0.5 到派 0.6 星中间应该有不少发表。但因为当时我在忙着搞这个派 0.6 星,可能有一些疏漏的地方。我觉得现在回头来看比较有意思的几个发表,分别有这个 olympics。

02:13:17 2

Olympics 这个发表是我们公司一个内部的一个好玩的活动。就是会不定期的让研究员和数据收集的员组成小队去玩一个奥林匹克。就看谁能够操作机器人去做一些很难搞,很想都不敢想的一些任务。因为毕竟是人在操作,其实这个可以非常大程度的去推这个 bounder,就是推你现在不说什么大模型,你就让人来操纵他能够操作完成什么任务,能不能把你想到的所有任务都真的完成。因为你人手能完成的话,机器人能不能完成?我觉得这是一个非常好的一个活动,所以我们当时就从这个活动里诞生了。

02:13:57 2

奥林匹克这边 paper 也是有专门的负责人去去思考,如何完成一些,之前别人提出过的,觉得对机器人是非常难的,并且在用人操纵数据完成了以后,再让我们的大模型去做去学习。然后发现取得了成功的完成了一些大家之前觉得会非常难的一些动作。然后还有你们。

02:14:19 1

完成了什么动作,这里面有什么好玩的。

02:14:22 2

我觉得比较好玩。因为我这个人很喜欢这个高精度的任务,就是拿出一个钥匙,然后去开这个锁的这种任务。同时也是有一个什么。我这有个开门这个任务,其实我我就是刚刚我们在做硬件的时候,我也是头几个去赶紧去尝试一下,因为它能做到什么地步的人。当时我就觉得开门这玩意儿真的是太大了。我在那儿好像搞了二十多分钟,我才终于想明白我怎么样用这个机器人的这个形态去让他开出这个门来。但是这边他们就可以做了以后发现,其实首先这个策略是可以优化的,并且这个策略化过或机器人是可以成功的自主去完成的这也是一个我觉得起来好像也没那么难,但绝对没那么简单的一个人物。

02:15:05 2

然后派 0.6 星到现在的话,我们应该是正在一系列的发表过程中,把这个上次刚刚发了叫做 partner。因为我们希望做成一个通用的大模型,它是可以在很多不同的场景和不同的机器人上跑的。所以派也是有一些和其他的机器人公司的合作的。

02:15:28 2

在这个 partner 的这个 release 中就谈到了我们和一家叠衣服的公司和一家打包的公司的合作。他们跑的其实都是我们训练的,或者说用我们的这种东西的一个大模型。在他们这个更加贴近商业落地的一个场景。你可以看到就是我们公司自己目前没有很多这种商业落地的这个想法。但是其实有在帮助其他已经在商业落地机器人公司去做他们的事情,也是在变相推动我们的这个研究的前沿前进。并且我确实认同这个 partner 的方法是有在就触碰了一些机器人的本质问题。

02:16:08 2

你看从我们开始搞机器人研究的那个时代,你干啥事都是你要知道找谁,而且他会懂你才能开始做。就是你你写个软件,现在是分分钟的事情。你上网问一下切 GPT,然后可能这个 AI agent 或者 cloud 就会帮你写很多东西。就是你作为一个开发者做一个研究员,你有很多的这已经做好的事情可以供你驱使。而机器人之前我觉得不管是硬件的皂还是软件,想让他做一个差不多像模像样的东西都是非常复杂的。我们可能是希望在以后,就是你这个人买了一个机器人的一个硬件的一个乐高玩具拼装以后,你可以直接插入我们大模型,他就可以做很多事情了。是希望把这个开从机器人从零开始做到第一个赛中间时间给缩短。

02:16:58 1

我有一个问题,因为你提到你们的硬件有很多。

02:17:01 2

的 partner,并不是说硬件有很多 partner,而是我们公司和其他公司有一些 partner 的合作。

02:17:09 1

那你们自己会做硬件吗?你们做的有多深?

02:17:13 2

这个有一些内容不太方便透露,但是我们在派 06 星中使用的这个硬件,其实是我们自己弄的一个硬件。它有优化一些,不管是稳定性还是方便这个任务。比如说其实你看,大家现在批评夹爪,批评这个简单手机器人就会说了,这个简单的手你抓杯子,你不会把杯子抓破了。但我们为了做这个咖啡机,我们就把我们做这个机器人,它是一个可换的带一点可换的这种夹爪。为了做咖啡你是需要一个另外一个夹爪,它其实成本都不高,然后换起来也很简单。但是你是有这种研发以后,你才会感觉到什么是一个比较本源的问题,什么是一个其实很很简单就可以。

02:17:55 1

解决的问题。因为我问这个问题是我知道有的机器人公司他们为了做一个更通用的机器人,它会让它的硬件为了软件优化 70%到 80%。那硬件会一直在为软件去做优化,你们会这样做吗?

02:18:11 2

我觉得硬件与其说是为软件优化,不如说是为最后的任务和这个表现和能做什么在优化。我觉得这个应该大家都在做吧,因为确实市面上没有一个已经定型的结束了的硬件的形态可以停止这种优化。因此我觉得大家应该都在不停的去干这件事情。

02:18:35 1

有人说派在机器人领域其实就是想要对标 open I 在大语言模型领域,如果这样对比的话,派现在发表到了派 06 星,你觉得他能对标 GPT 几?

02:18:48 2

这个问题好难回答,因为我确实认同,我觉得派的一部分的构思成为一个 robotics 界的 OpenAI,成为一个通用大模型的创造者。至于我们现在大模型发展到哪里了,我觉得你将好就是你每天在这儿看你就看到那些不好的东西。我每天看到都是说这个表现没有很完美,那个表现也不行,我们要怎么把它搞得更好,这个是我比较每天日常里会想的东西,或者说本源的想一些,就是这个模型是不是还有一些大的变革,才能达到我真正想要的一个效果。所以我觉得我们还没有到,但没有到一本。对,但我觉得我们在靠近了。

02:19:29 1

你觉得什么时候能到 GPT1?

02:19:31 2

我觉得其实因为起点不一样,就是 NLP 的起点。我在 2017 年刚读博的时候,短暂的做过一阵子 NLP。当时可好笑了,你知道吗?我当时在想说这个自然语言生成感觉不太行,这我怎么训练出来的东西,天天就在那就叫他写莎士比亚,他就天天在那啧啧啧。因为这是一个概率学上最容易 predict,就是预测一个单词。他还不停的预测一个单词,就天天就跟我说说我说这没用,这不行。

02:19:59 2

然后人家看跟我说,他们在用强化学习做这个大语言模型。我就说强化学习也很难搞的,你把这个特别难搞的 A 和特别难搞的 B 合到一起,你就能做成功吗?我完全不懂。然后到了 19 年 20 年别人就做成功了,就说这个你看做的多好。

02:20:16 2

当时就能够感觉到问题是有一些不一样的。当时我从自然语言转换到了机器人,觉得第一自然语言里面你可以生成很多文字,你怎么给这个文字打分,怎么知道什么是你想要的文字,很难。所以当时觉得自然语言做强化学习会很难,就是因为觉得这个打分太太含糊了,不是那么的清晰。当然后来有很多就随着更多的数据集的出现了,他们也不断的建立了新的标杆。所以他们这个标准可能会有那么一阵子逐渐变得清晰的过程。

02:20:49 2

然后另外一方面是觉得当时做机器人好玩儿。因为机器人可以做很多 task,很多任务,这个任务都是你可以拍脑袋想一个新的任务,然后他做。我觉得这个乐趣是机器人里面一个非常 tRicky 的点。

02:21:06 2

因为自然语言很多时候你可以用语气描述,你想让他做的这个任务,对吧?你可以说我今天有个问题给你,我想你给我写这个代码,然后你可以不断的去补充。就自然语言的这种跟智能体交流,你想他做的事情是什么事情,是一个非常天然的一种交互方式。而机器人其实我觉得在这个 VLA model 出现之前,就没有很天然的这种方式。即使现在 VLA model 出现了,我们也是在探索,为什么我是一开始完全没有用过 vivo a model,然后现在其实反而是有一点欣赏 via a model。就是因为如果我跟这些 cloud agent 提的很多要求都是用语言来表述的那我是不是我跟机器人也可以通过语言来提这个要求。然后这个语言的要求就会影响到就是你在没有那么多数据情况下,你可以完成一个具体任务,其实这是机器人的一个优势。

02:21:54 2

我觉得在自然语言界没有那么多数据情况下,完成一个具体自然语任务其实有点难。我们现在就相当于是在数据量与对方这个业界完全无法比拟的情况下,其实你已经做了很多东西出来了。所以我觉得这是一个非常有意思的点。

02:22:08 1

如果我们往后推演一步,你看今天的大模型发展,这些模型公司慢慢都变成应用公司。因为大家发现模型是商品化的,它会慢慢的统一和同质化。所以最后大家构筑商业的不同和护城河,都是通过一个不一样的应用来进行选择。我觉得如果放到机器人这个领域来,是不是今天你们出发可能是一个通用大脑,但慢慢可能也会做成不一样的产品形态。然后每个公司的产他的产品形态是不一样的我。

02:22:38 2

觉得也许会,我觉得大模型现在是依然有很多的竞争,在竞争中刺激了很多的研发,刺激了大家对一个更好大模型的追求。我不太确定就是像 OpenAI 的对的这个产品,难道就不能拿来做写代码了吗?以前也是可以的,我不知道他们现在研发哪一步或者怎么样。只是最近可能大家都是在用 cloud code 这么一个 AI 工具做代码。但是他们因为都是一个多功能的大模型,我觉得没有任何事情告诉我是他们根本上做不了这个东西。只是你说的这种就是产品形态开始发生了一些分歧分化。我觉得也许是可能的。但也许一种可能的形态就是有一些人是专门做大脑,还有一些人他们专门做这个场景的商业化和为了这个场景的商业化所做的很多事情。甚至他们最后也可以插入别人公司的大脑,是这是一种可能存在的形态。

02:23:33 1

你觉得机器人会出现一个独立于大语言模型的独立的大脑吗?据我所知,大部分的团队还是在基于一个多模态模型上去做后训练,做一个机器人大脑。你觉得一个独立大脑就是说要专门的为机器人大脑去做预训练、中训练、后训练,它是一个自闭环的完整体系吗?

02:23:54 2

我觉得是有可能的。但同时可能也有派人的认为是说所有这些东西都可以归到一个模型,而且这个模型还没有被创造出来。我觉得从这个角度上来说,确实就是如果有一天就是有一这么一个模型它。能拿到所有的我们能想得到的模态和做这些自动化上的必要的任务。不管是语言沟通、图像编辑、什么视频生成,或者说机器人的操控,它也可以是一种可能性。那个时候也许其实也在。

02:24:27 1

异性恋里了。从你们内部看,现在看到。

02:24:30 2

skin 路的迹象了没有?我觉得 scaling law 是一个非常 tRicky 的话题。因为 scaling 也有很多,就像泛化有很多不同的衡量标准也好,scaling 也有很多不同的衡量标准,每次当我看到有一些是 oversimplify 就有点过度简化的这种陈述的时候,我都是会有一点觉得不够太细节。

02:24:52 2

比如说 scaling 你看在排 0.5 里面做的,就是你在十个房子里面收的数据,你到第 11 个房子里面你能跑起来不?你的表现是在哪里?比起你说了 100 个房子以后,你再到这个房子里来是不是有一些长进。那你再说 1000 个房子会不会其实提升就没有那么大我觉得这可以看作是 scaling law 的一种探索方法。就是我们要收多少个房子才能够在下一个新房子里取得一定的成果。同时你收过多少个房子以后,这个新成果可能就不能提升,就没有那么明显了。我觉得这个在派 06 派 05 给我感觉是它确实是可能可以摸得到的一个有限数据可以达到的地方。但是我觉得我们现在数据量还是太少了,肯定还是要再激进一些,我觉得会好玩。

02:25:36 1

你们算力够吗?算力多吗?我觉得算力够不够。

02:25:40 2

是看你们这人喜不喜欢干活。你们这人都特别喜欢干活的话,算力永远不够,永远都可以有新的想法,新的实验和创新的模型。

02:25:50 1

你们那人卷不卷?

02:25:52 2

我觉得大家你从一个工作时长的角度上来看的话是很多。但其实这并不是他强行要求你在公司要待到什么点,而是还相对而言比较自发的。就是今天在公司吃完晚饭,又又跟这个人开始讨论起了一个什么话题,就想往下再走一走,再看一看。所以有的时候大家可能工作还是挺长时间的在那儿,甚至包括周末也有不少人会去公司,也是相对而言比较自发性的。就是觉得下周想出这么一个结果,那今天就把时间跑好,或者说就是突然来了一个想法。那就深夜聊天呗。

02:26:25 1

聊你们好像都是。

02:26:27 2

没有加班工资,对吧?没有。

02:26:31 1

你们一般早起晚起没有的。Typical day 是什么样的?作为一个害的研究员。

02:26:37 2

每个人都不一样。其实甚至包括有些人他们住在南湾,然后又来三旧金山这个城里,他们每天来回开的时间可能就 3 个小时的车。像我的话我是比较夜猫子,所以我基本上白天我就算起来,我可能不会在公司。我在家里以前工作一段时间,给自己一个洞穴的时间,然后差不多是中午过去,然后到了晚上我要是兴致来了,可以干到非常晚,可能会干到晚上两三点这种才回家。我一般是一两点回家,洗了洗脸,睡前再干一会儿。

02:27:09 1

对,然后你们都。

02:27:10 2

不用打卡对吧?我们没有打卡这个东西。对,甚至有些人他可能家里有些事情,比如说其实这边有研究员他们正在生小孩,他们就在家里可以直接待很久,但大家也会,所以他也会有继续他的工作,就是相对而言是一种比较自由的氛围,让你决定什么样的工作方式是最适合你的。同时公司也可能希望大家变成了一个团队以后,可以连到一起发挥作用。

02:27:35 1

那你们会有例会这种吗?

02:27:37 2

最早是有的,就刚刚来公司的时候,这个例会给我这个夜猫子带来了非常大的困扰。因为例会是每天早上十点钟到公司,大家轮流说一句话自己在干什么。因为当时公司就 20 个人,但是当时我就跟 CEO 说,怎么十点这么早,我们能不能改到下午?然后他就很震惊地看着我说,他们最早是八点会退到九点,然后退到 10 点,怎么我还嫌十点也早。对,后来的话随着公司我觉得人数增加的管理方法可能是需要改变。所以现在的话就没有这种每天都有例会,只是有一些研究的会和每个课题自己组织的一些会。现在多少人了?现在我的体感可能是大概 70 个人,体感因为我也没有,就天天在那数我们公司有多少人。

02:28:28 1

你有几层楼。

02:28:29 2

我们现在还在我们最初的那栋楼里待着,这栋楼我觉得真的是第一,它是非常有创业氛围的,就是这栋楼它比较的朴素。本来然后我们来了以后,就把所有的这个硬件软件都带进来了。但是另外一方面,就现在人实在有点太多了,这个萝莉真的有点坐不下。我们这东西可以播吗?就是我们的会议室里面有一个二氧化碳检测器,这个二氧化碳检测器在这个会议室里面的人超过大概三四个人以后,有的时候就会突然一下跳成红色警戒。我们这个时候就没办法。

02:29:01 1

就会把这个门打开,然后接着干。你可以就说明该换办公室了。

02:29:05 2

确实是大家都非常期待能不能换到一个新的办公室。但在旧金山,在创业氛围如此浓厚的情况下,没时间,我觉得挺难找到一个非常适合我们这样公司的一个办公室。因为我们也有一些硬件的元素,我们有自己的办公室里是有机器人的,你还有一些什么用电用网的一些需求,就是找到一个非常合适的地方,没有那么简单。

02:29:27 1

你们的组织和文化。

02:29:29 2

是什么样的?我觉得现在还没有一个章程去非常详细的规定它。但是可以看到公司现在发展了快有两年了,它是有一些自发性的一些文化的因素在里面的。它整体而言,我虽然也没有在其他创业公司呆过,但感觉我这个应该就是我想象中的创业氛围了。你看大家都比较踊跃的去做一些自己觉得非常重要的事情,然后同时尽可能的就毕竟创业,你们都是有一些股份,然后也是有一些 stick 在这个公司里面。你是希望公司变得很好。即使有的时候不是你的氛围内的事,你也会去想要去做好。

02:30:08 2

同时我们公司比较特殊的,因为是比较开放的研究氛围,所以是就我们我和另外一个人会组织一下读书会和一些交流会。可能读书会就比如说比如说我们现在想做一个项目,比如说这个派 06 星派 06 星其实是去过两次这个读书会的。首先一次就是给大家讲一讲我们现在想要探索这个问题,这个问题以前的人的发表和东西都做到什么地步了。然后我们觉得它的应用就是会有一两个人主讲,然后其他人可以问问题,或者甚至质疑,都是可以的。就是看怎么样能让大家尽量的在这个课题上感到同样的激情。然后同时有几个人主要去负责去做。然后做到后面快成熟之前,其实又上了一次读书会给大家交流下,现在做到这个地步了,你们觉得怎么样?

02:30:54 2

然后有一些比较天马行空的读书会,比如说 cloud agent 出来了,然后就疯狂的坐在读书会里面说到底谁是我们公司最能用号的 agent 的人,赶紧让他上台讲一讲就怎么用,然后大家就可以抄他作业,就是这种操作什么创造什么。就是我确实在,就是我当时正在埋头干一些别的事情,就没有怎么关注到。然后他们给我们介绍了一下,就他们怎么用这个 cloud a 我都听完以后惊了,我就说这个确实是生产力的飞跃式进步。大概最近两周,我就是把自己的整个工作的这套流程都改了一下,就觉得现在跟一年前也完全不一样的一种工作思路了。

02:31:32 1

能工作到你之前工作的多少倍,你的一天的工作量。

02:31:36 2

我觉得效果上来说,我觉得应该有个三四倍。但是研究就是一个不停的打一枪,看看这个子弹落在了哪里,调整这个子弹。不,我觉得不是你疯狂的打枪就能够打出什么东西,还是需要一些人的 input。

02:31:54 1

你们 CEO 的管理。

02:31:56 2

方式是什么样的?CEO 的话是 caro houseman,他是是他其实在公司主管的方向并不是那么的侧重研究,因为研究方面的事情更多是由 sergey 和 elsey 来负责,所以我和他打的交道并没有那么多,他管了一些公司的基础架构。你可以认为我们公司里面有很大的一部分工作是研究,但也有很大一部分工作是如何保障这个研究能够高效快速的进行下去。卡尔是有,主要是很多负责在这个方面上。

02:32:26 1

他就是 sam 奥特曼那个角色,类似于可能也会未来会做一些商业化,如果需要的话。

02:32:33 2

他们怎么想的?其实我在 2024 年,就是刚刚他们开创了以后,就是说要不要去聊聊,我就问他们,你们现在做人形吗?你们现在要做什么商业化吗?我当时感觉。

02:32:46 1

都是痘是吧?

02:32:47 2

感受到的氛围就是确实我们不做人形,因为他们要说做人形我就不来了,你知道吧?为什么是很担心不同背景的人去做人形的,比如说现在人形公司。

02:32:59 1

的做人性你就不来了神情。因为我觉得人性。

02:33:02 2

是一个非常值得研究的问题,但绝对不是我现在最想研究的问题。为什么?如果他们做人形,我就会担心他们的研究重心就变成了如何做一个更好的人形机器人,而我的研究重心就是做更好的任务。

02:33:17 2

我个人是非常相信不需要人性冲突是很好的任务的,而且不需要人性就能使用派的角度出发更快的做出来。比如说你看现在叠衣服什么的,都是我们先做好了。叠衣服、叠盒子,还有包括现在做咖啡,都是你先做好了,他不需要人性他就可以做。而且我觉得有更多非常多的任务,都是可以无穷无尽的任务等着我去做。我要是把时间和精力都花在了怎么样让人机器人跑得更好上来说,他不是我这个人的工作重点。我觉得这是一个。

02:33:44 1

taste 的问题。如果让任务更通用,你未来的硬件是多样化的吗?还是它可以统 1 到 1 个硬件上?

02:33:51 2

我觉得也可能是我觉得现在我们作为一家通用大模型公司,比较考究的其实就是它在不同的机械上的表现,他在不同的剧情的上面的表现。

02:34:02 1

就是你不追求未来的世界所谓的机器人,就是人形机器人那种统一的美感,对吗?你觉得他不随便都可以。

02:34:10 2

我这个人最喜欢的就是宠物机器人。我有一个朋友他说他要创业,创这个宠物机器人,我一听可来劲儿了,就恨不得要不是因为现在做的事情,也是很想做的事情,我还不如加入他。因为我就会觉得每个人在机器人这个领域里面都是有非常多复杂的线的,很有意思。

02:34:28 1

宠物机器人你想做哪种宠物?

02:34:30 2

什么宠物都想做,宠物实在是太可爱了。我觉得这是人文的情绪价值,就是大家活在这个世界上的一些意义,我觉得陪伴是一个方向。说了很久派。

02:34:43 1

你当时为什么加入派?

02:34:45 2

当时也是好凑巧,因为我其实整个博士期间一直坚定的以为我要想去当教授,但是一直很害怕当教授,因为教授要写好多什么 funding proposal,就是吸睛升起了。我一听到这个 funding proposal,我就觉得我想解决问题,我不想搞这些事情,可能这也是我的还需要修炼的一个部分。但是当时 ChatGPT 横空出世,我就一拍大腿决定吻了。我现在可以去当教授了,我不怕了,我用切 GPT 帮我写这些资金申请就可以了。

02:35:17 2

但是在我其实经历了一整轮的教师面试中间,就有一些感触,很有意思。因为我之前的研究其实没有很多大模型,我虽然做了很多机器学习,包括各种机器学习方法的研究,但我用的模型都比较小。这个跟我们实验室的氛围和我们当时都拿到了计算资源也是有一定的关系。大家可能说把这个任务做到就好,不要想太多,就是其他的事情。所以当时注重的点没有那么多大模型在教职申请的过程中,我也是以一个更加偏向传统的一个故事在市场上找这个教职。然后能越来越感受到大家对于这个大模型的热情,就包括我自己其实也是非常大的好奇心。然后又因为非常巧合的就是说给他有一个学生就是阿比阿比克。他毕业以后来到了华大,就是我就读的学校,并且成为了我的小老板。

02:36:08 2

因为我们华大以前没有一个真正意义上专门做 robotics learning for manipulation 这个话题的人。然后阿贝谢一来以后,我就说,我做的跟你做朋友好近,我们一定要天天交流,然后我们就天天交流,然后顺便就成为了也算是半个班的学生。可以,一方面就是他也会用 founding 来支持我的项目。另外一方面我们的我觉得我们的合作很紧密,然后有很多相似的想法,就是跟我老板的交流完全不一样。老板更多的是像一个干这种对话网络里面的一个 critic。他就说了你现在生成了这个东西,但是你要达到更好的这个标准才行。而阿贝雪跟我的合作方式的话,就更加的是我们俩我有这个想法,我也有这个想法,我们把这个方法揉一揉,不行,再再再生出了三四个,又有了新想法。

02:36:51 1

然后哪种方式对研究更好,我说都有是最好的我。

02:36:55 2

真的是黑猫白猫,抓到老鼠就是好猫。因为我和我自己的导师那么多年的合作,让我有一种求真的非常强烈的求真。就是包括大家在就我在看别人的 paper,看别人发表之后,也是会经常比较喜欢打破砂锅问到底的那种。甚至有的时候我就自己做一遍,看看是什么样子。而阿 BC 的话给我一种他非常跳脱的一种创造力。确实之前想的时候,很多是我一个人想在洞穴里面待了一阵子。但是如果要真的做成,我们得退一步,然后思考,然后到底发生什么事,然后去比较漫无目的的去梦想。我觉得这两者结合是很好的。

02:37:32 2

因为当时阿贝切尔是 circa 的学生,然后 sergi 在联创的时候,阿贝切尔可能就跟他说了,有这么一个人,他要毕业了,他是做这个的。然后四哥就说可以去聊聊。然后我本来也没想去聊聊,因为我听说了他要去创业,我说这好像跟我没什么关系。但后来又转念一想,觉得 sarkee 他毕竟是一个学术界里非常有影响力的教授。我去听一听,跟他第一次真的面对面,就要深入的去交流一下他到底在想什么。也挺好的。然后当时就是去朋友家玩,在弯曲玩的路上顺便去拍。当时他们刚成立一周内,我就去那边坐了一下,看了一下,我不知道那就是是那是个面试,他们没有人跟我说这是个面试。

02:38:14 2

我就很就那种有这个人在这儿做这个,挺有意思,你们在做什么?然后他们后来给我的反馈是,就是他们说我觉得我他们面试我的过程中感受到了莫大的阻力。因为我不停的在问他们,你们在干什么?

02:38:27 1

他们你是这样的是这样吗?对。

02:38:29 2

可能也是一种求知。所以当时我就特别好奇,我说你们在做这个你讲这个任务是怎么想的?我来多了解一下。然后他们说他们想的是我是来找你来面试的,应该是我来问你们怎么变成了你骗我们。但当时就是聊完了一下以后,觉得就没有接触之前肯定是有很多猜想,但没有一个能确定。然后聊过了以后觉得这帮人还是挺求真的我觉得学术界有很多发表,有的时候会让我这个实用主义派觉得有一些无奈。就比如说你要做一个问题,想把它做的更好,你会说之前做做不更好的一个原因是这个原因。所以我们出了这个问题,有的时候他逻辑不一定那么通顺。

02:39:12 1

就是你可能不认为这个是为了自圆其说。

02:39:15 2

对,有的 paper 是有一点这个感觉的,当然也可能只是大家的想法不同,但是我肯定是希望找一个和我的想法比较贴切的。然后我觉得当时和派的人交流,我觉得大家还是非常求证,所以他们就给了一个 offer。然后我也很莫名其妙,我就觉得确实挺好的,非常感谢,但是我还是在找教职。

02:39:34 1

Offer 有吸引力吗?我觉得是一个机会。

02:39:37 2

我觉得 offer 具体的内容并不是最重要的对当时的我来说,这个 offer 代表的是我能和一个已经曾经做过非常多成功工作的一个团队。然后他们里面每个人和我交通都非常和我的沟交流沟通都挺愉快的,和他们一起共事。到达一个新的平台,可以做很多不同的事情,这个才是 offer 我觉得最重要的部分。

02:39:59 2

所以当失去了找教职的最后,就突然有些顿悟了。觉得我还得想一下自己究竟想做什么样的研究。之前的我可能会觉得时机没有到,我应该先到一个地方去仔细的思考,带一些学生。我非常期待将来有一天,也许真的会学术界丐帮和我们这些人想的完全不一样的人我觉得这个是最值得期待的一种发展和演化。但是我没想到这波来得还挺快的。他已经让我感觉到,我得知道我们现在的这个新的这种前沿能做到哪里,在做什么,我能怎么样去做它。所以当时就是比较突然的,就在毕业的时候辞掉了这个教职的 offer,就转身加入了派,是一个非常偶然的决定。可以这么说,我当时在毕业 thesis defense 结课的时候,我老板都跟所有人宣布他要去当教授。不不不。

02:40:53 1

你找到教职了是吧?

02:40:55 2

对我当时其实非常想去剑桥教职,拿已经拿到了,是包括我自己也是心里非常感谢。我觉得剑桥的人文的这个属性和我个性非常的贴合,我觉得在那里就可以又做研究又写小说。在这里的话写小说就是晚上睡不着觉写两笔。

02:41:16 1

这个很有意思,你为什么在最后一刻。

02:41:19 2

辞掉剑桥来了派?这个和学术界的运作方式,和工业界运作方式或多或少有一些关系。我在学术界我觉得有一个比较大的问题。其实是你是学生来来走走美国的学术界大概是五年,其实英国更短三年。我当时就会想说,一个学生来,如果我想给他一个放手去做,做一些比较开创性的工作,三年他够不够?因为我当时你可以看到,我是一个半道出家的博士生。我不像现在很多非常优秀的本科生,他们本科就做了非常多相关的研究。他们到他们开始是读博士的时候,我觉得都已经非常了解自己的行业。

02:41:57 2

我觉得如果我要去招学生的话,我会非常喜欢这种学生。但我也可能也会喜欢一些敢于抛弃自己之前做的东西,去探索一个新的东西的学生。而只给他三年,只给他五年,甚至是不是会时间不够。然后一个学生来了,做了一个项目以后再走,可能你一个东西开了个头,我觉得这个。这种模式在现在这个环境下可能确实不一定都能做到。

02:42:20 2

我想做的这个东西。同时就是在工业界做的话,会有更多的不管是算力数据还有硬件的知识。你可以看到机器人它是一个非常多元化的。就比如说我做的时候,我做的其实我 PHD 整整读了七年。第一年第二年你可以认为砍掉的话跟我后面做的事情也没什么关系。但确实我觉得对我后面做的事情有帮助。

02:42:42 2

然后我开始搞真机,就搞甄姬,这个事情就很麻烦。就是我从开始想搭机器人到这个机器人差不多能动大概三个月的时候是第一次,就是机器人差不多整体都跑通了,然后六个月才真正把瑶操纵这个玩意儿给全部定下来,都是我一个人做的,很慢。在后续的做的火的过程中,肯定也有不可避免的。因为是个全站,就这个站哪里坏了你得自己上。在学术界这种相对而言更加单打独斗,需要比较大东西的东西你都做不了。所以我觉得这个是拍当时最大的吸引力,就是我其实没有真的在一个大公司的齐心协力的合作下去做。而我也确实承认,我觉得这是必要的。

02:43:23 1

说到博士,我突然在想博士是越快变越好吗?

02:43:29 2

你看我读七年,你问我这个问题。

02:43:31 1

就是你说到七年我在想这个问题,因为有人可能从第一天就会想我要几年毕业。

02:43:38 2

我觉得性跟性格有很大的关系。我认识很快毕业的,也认识像我这样我们华大的记录是九年。我刚进校第一天我就认识了这个在学校待了八年的人,他是第九年毕业的。但是我觉得和自己生活状态有关系,我在读博求学期间做的很多项目我都非常喜欢,所以没有觉得时间过得很慢。

02:44:01 1

你没有很焦虑就为了毕业很焦虑。

02:44:03 2

没有为毕业很焦虑,也没有觉得就是我没有毕业是个什么样的一个事情。可能更多的是比较纯粹的去想说,我现在做了一个问题,上一个问题我学到了什么?下一个问题我想做什么,是一个很连贯很很快乐的一个过程。

02:44:17 2

同时当时博士期间单打独斗的项目有个好,就是你想休息就可以休息,不想想干的就可以干,你可以卷到半夜。我我我就超级夜猫子。我当时一般是中午下午开始干活,然后干到晚上四五点。因为可以免费停车,然后只干完了还能去一个 24 小时的营业的炸鸡店,吃两口炸鸡,就非常快乐的一种生活。同时也可以觉得最近好像做了一个角度非常深入,但是就是思维很迷茫,我们去休息一下。我有一两个项目其实都是我在圣诞节度假的,就突然有一天突然灵光一现,就觉得要做这个会有很大的自由度。而我见到的很多就是三年四年就毕业的博士生,他们确实可能比金刚经像的我来说的话,要非常更加明确自己要想要做什么。我的话更多的是尝试换,一直到最近可以说我的职业才真正的有一些稳定下来。

02:45:09 1

你觉得在 pi 工作和在 google 工作的区别可能会是什么样?他们都在做机器人大脑,而派的人当然也是从 google 出去的。

02:45:17 2

我没有在 google 的研究部门工作过,我在那边做过软件的实习。当时我还是一个本科生,去了 google 以后就觉得非常快乐,因为 google 就像是一堆软件工程师为自己所搭的一个乐园。我是在 google 那边开始第一次学怎么写 TensorFlow 和大规模的一些神经网络的训练。因为之前都是手错,就是你会从头开始写一个什么 CNN 怎么怎么反推的,你会从头到尾都自己写。然后到了姑姑才发现,有别人做好的一个库,我就调用这个库就行了。这么方便吗?我赶紧学一下怎么弄的。所以我相信 google 是有一个工程师的这种基因在里面,让我当时的我对他就非常的喜欢我觉得现在他还有体现。就是比如说他们做的研究,他们做的多模态,他们做的这种 TPU 这种架构,都是有着一种工程师的优化的思想在里面。

02:46:05 2

而在派的话,说到底他是一个创业公司。我可以非常轻松的跟我想聊的人开始聊天,可以 move fast。可能你昨天有个想法,今天说一说,明天就变成了一个项目。还有包括派 06 星,他的这个中间有一段就是突然一下非常大的转变,就是我们说我们要收医保给他了。我们现在收的这个评测对他的量是这个量。但是如果我们想要达到我们想要的地方,可能需要这个量。怎么样很快的给他排查达到这个效果,我觉得这个可能是我们比 google 我想象中要做的快很多的地方。

02:46:39 1

你说你现在的研究方向稳定下来,就是稳定到了强化学习。

02:46:43 2

不一定是强化学习,而是做机器人,并且想怎么把机器人做得更好,而且是一个比较通用语境下来更好,这个是比较稳定的方向。强化学习只是这个阶段的一种研究的重心,但我不觉得它是一个定义你研究生涯的一个东西。

02:46:58 1

你的强化学习对于机器人说意味着什么?它解决的是本质的问题吗?

02:47:03 2

我觉得强化学习是一个非常本质的一类问题,也就是说一个人如何通过体验变得更好这个问题从最传统教科书上来说,解释强化学习其实就是解释这个巴普洛夫的狗。这个狗它做了一个事情,你就给他一个奖励,他从此就知道这个事情是个好事情,我要多做,就是通过这种奖励和惩罚的方式,去让一个智能体做一个对你来说更好的一个动作。但强化学习它在算法上来说,我觉得是有一些东西我包括每天都会就感觉他跟我这个人进化,就是人的自我的提升和强化学习是有很多关系的。不管你是从一个非常具体的一个动作,比如说你是一个假想象中,你是一个想要学习攀岩或者游泳的一个人,然后你怎么样做的更好,你就是不断的去做这件事情。我觉得这个追求极致是强化学习一个非常强烈的一个因素,就是不停的去练。

02:48:02 2

同时强化学习其实还有一个很重要的部分是探索。探索我觉得它是可大可小的,可能是说我这个肌肉稍微的往左移一下,我的表现打网球的表现会更好,这是一种探索。也可以说是我现在做的这个研究,我想怎么把这个机器人做好。我现在探索的是一个方向,我有可能将来会换一个方向,它也是一种探索。

02:48:22 2

我觉得它是不光是一个具体问题,具体场景,其实也是一个通用通向通用的一条路。比如说现在我觉得大语言模型里面应该有不少人都在使用强化学习来帮助提升他们的大语言模型。其实也是有一个单元模型的基础上,让他不停的去是去看,去给反馈,如何从这个反馈中得到更进一步的提高,是一个很久的命题。同时我觉得强化学习具体的技术也有可能也有很多是可以讲的部分。如果你有兴趣我们也可以多深入一下。

02:48:54 2

我觉得强化学习是有几个模块的,就是每个强化学习系统都是把这些模块拼起来。其中一个模块可能就是这个探索模块。如果你想要做一件更好的事情,你得做一些你以前没做的事情。你怎么样选一个更有可能成功的事情去探索,是探索模块。我觉得这个方面其实在咱们现在做的不是特别多,但它是一个永恒的命题,是你是选一个小的改动还是大的改动,包括你怎么改动都是一个算法需要。

02:49:25 2

我觉得在最后的大模形态里面,它其实应该对于探索是有一个非常清晰的想法。现在大模型可能还不具备这样一个非常主动的去探索的一个能力。这个探索直接就影响到了如果你选得好,你研究路线选得好,你可能做了这一个研究,就已经有很多好的事情发生。如果你这个研究很不幸的就是选到了一些比较难搞的一些东西,那你们就要做很多。他就极度的影响到了你学习和进步的这个效率问题,所以是探索问题。

02:49:54 2

然后第二个我觉得强化学习比较有意思的问题就是归因。可能你要让你们家宠物做一个什么好事儿,可能他做了一系列的事情,然后你最后给它一个奖赏。他其实是需要知道到底哪个事情是这一次得到好奖赏的一个决定性因素。这个也是他零售星是有一些探索的。就是你收集了这么多的部署的数据,究竟哪一条部署数据里面的哪一个步骤你做得好,让你整条数据得到一个关键性的一个奖赏。

02:50:27 2

你可以看到在派 06 星里面,我们可能比较强调了这个 super 的一个速度和质量。所以从智能体的角度上来看,就是他做了很多事,做了做了不停的做了这么多次。然后我们设计这个算法,帮助他从这么多次经验中找到这条数据里面其他都是垃圾,但这个地方是精华,你以后多做这个精华。所以这个归因我觉得是强化学习的一个,就像人的这种总结反思一样,是一种可以长期持有的能力。就不管是在微观上这一步骤再做改一下就会更好,还是宏观上来说有这么一些策略,其实这个策略是最好的。

02:51:05 2

然后同时强化学习也有着,我觉得有一个本源性问题是我们其实教科书上不怎么讲的,就是这个问题的定义。你可以看到在这个大语言模型里面,你要什么问题,你一般都用口述给他抛出了一个问题。可以说你的这个问题涵盖了很多,他需要知道就是他你的这个问题就定义了他这个任务。而在机器人界目前还没有这种清晰的一个联系,包括这个 VLA 模型也只是开了一个头。说我想让你叠衣服,其实你可以千千万万不同一种方式叠衣服,对不对?你怎么知道他要你叠衣服,到底是要叠成什么样子?

02:51:42 2

在课本里强化学习是要用一个奖励函数去抓住这个东西。可能这个奖励函数就设计成了一个,如果你真的按照他的意思给了,他就给你一个很高的奖赏,就给你一块肉,奖励你这个狗狗做的好。如果你做的不好,他就给你一个惩罚。

02:51:58 2

但实际上设计实用的来说,设计这个奖励函数是非常难的。因为之前有人做过很多在模拟器里做强化学习。比如说用强化学习去打这个超级马里奥,你有一个分数对不对?你就优化这个分数就好了,这是一个现成的奖励函数。但实际上即使是这样的情况下,它有可能会我们就是 abuse,就滥用这个奖励。他就发现了有一个 bug,就超级马里奥一个 bug。有了这个 bug 以后,强化学习就发现了,就疯狂做这个 bug,他就会跳一个小人,然后直接通关了所有的关卡,并且触发奖励函数达到最大值。

02:52:29 2

我把奖励函数给你优化出来了,你有还有什么可说的?我已经做到你想要我做的事情了。但实际上这个奖励函数一开始设计的就不对。所以我觉得强化学习的一个工作目标,也是一个很重要的事情。其实就是把人想要做的事情和机器能够理解的这种奖励函数紧密的结合在一起。同时也希望这样一个设计是可以泛化,可以鲁邦的。

02:52:49 1

谭姐也提到强化学习需要奖励信号,但是很难写奖励函数,这个你们有什么发现吗?怎么能给一个任务写清晰的奖励函数?

02:52:58 2

我觉得在我看来它不是一个写奖励函数的问题,而是向智能体传达你让它做什么的问题。奖励函数可能更多的是一种表现方式。比如说你看现在 NLP,他们之前应该也有这种探索过,就怎么给他写一个价值函数,就做了这个好就是好,就是更高分,做的那个不好就是更低的分。

02:53:18 2

但其实有一段时间在在自然语言中的强化学习,最有用的东西就是可验证的一个任务。这个可验证的任务它是可以独立于一个所谓奖励函数存在。它就是一个让你写编程,你这个编程能跑的话,它就是非常确定的知道它是好。我觉得是传递好坏不一定需要奖励函数。而且我相信传递好坏的这个任务的话,是需要一些人的这种 common sense,这种浅知识,或者说通用知识。同时也是一个我觉得是一个非常 flexible 问题。我个人比较相信好的奖励函数是可以因地制宜的,它也不一定是一个奖励函数的一个形式在存在。更多的就是你给的这个模型的信息和表达去让他理解。

02:54:02 1

因为我前两天聊了一个嘉宾,他是做 AI for map,他们核心想优化的就是模型的可验证性。这个会不会对我觉得。

02:54:12 2

是是有对我们是都有启发的。对,因为机器人它也有一个很好玩的问题,就是咱们也没有那么多的任务是非常清晰的说成功和失败都非常简单跳出来。你可以比如说就是这个杯子放在另外一个桌子上,也许是的,但这也是一个非常限定的。就是你当到了一个限定的环境以后,你可能就比较容易写出这个降临函数。而你在一个非常通用的层面,你其实很难写出一个通用的函数,或者你的任务比较难。

02:54:40 2

比如说像叠衣服这种任务,叠衣服叠的好不好?老师我都不怎么叠衣服,所以我在叠衣服的这个任务设计过程中,我就有一个比较清晰的。就是因为我从来不叠衣服,所以我可以很纯粹的从机器人任务的角度来说设计这个东西。但是设计出来的每个观点。

02:54:56 1

也是不一样的。你刚刚提到 chelles 对于一些任务的设计很有 common sense.

02:55:01 2

我觉得他有非常的 sharp increase。

02:55:03 1

你们打举个例子。

02:55:06 2

就比如说叠衣服这个东西是有很多不同的策略,对不对?你人来叠,你可以把它从两边叠成这个,或者你也可以四四方方的叠。我我我甚至用语言都很难描述这不同的方式是怎么在叠,但你可以想象它有不同的叠法,那么哪些叠法,甚至包括这个叠法在机器人身上哪一个是好的。我觉得有一些人确实是能够很快速的直觉性的搞明白,这个点跟那个点是有差距的,或者说像我们会经常看一些机器人中间做的任务,就会去就斩钉截铁说这个任务我觉得可以做。虽然看起来很难,我觉得消费有很强的这样的东西,或者说他也会觉得这个数据好。

02:55:49 1

这种直觉来源于什么?

02:55:51 2

来源于一个人理解是有的,然后理解也是有的。但是也有可能就是和每个人看问题的一些看中的东西。

02:56:00 1

你觉得 BLA 会是一个终极的架构吗?他会怎么演化?

02:56:04 2

在未来我觉得这种 interact 的方式是可能可以的,尤其是在我天天成为了 cloud code 的重度用户以后。我以前是有一点怀疑,我说我这个人比较内向,就没有那么喜欢说话。有很多事情是不是不用说话的表达会是更好的表达,而且包括说话有很多时候,比如说就是我想让你帮我把我家的这个厨房收拾一下,他没有办法 capture 我所有的意思就是我可能说的是你把垃圾倒一下,然后这边橱柜全关起来,或者这样或者那样的一些单纯用语言无法捕捉到的重点。但是我发现了这些 cloud agents 就改变了我对这种交互方式的想象。就是你是可以说话,他可能阻止不了所有的重点。但你也可以用说话给他提供更多的 context,让他自己去搜索或者制定计划。

02:56:55 2

说话确实是一个非常强的逻辑思维和推理,而我也越来越觉得逻辑思维推理对机器人是很重要的。所以我觉得 VLA 中的 L 还是有很大作用的。只是 VLA 现在的这个架构可能还是比较原始的一个架构。它虽然有这个 language,但它并没有很多的去探索 language 和动作的一些非常细微的事情。比如说 language 的层面更多的都是碟。这个衣服他也没有很详细的描述说这个衣服叠的时候你要用两只手在这个步骤怎么样。我觉得这都是未来的探索方向,就是可能会有一些更加,就不光是从输出端是动作,或者加一些 video,或者加一些 loss 在输入端可能也会给他更多的 context,使它能像现在的大语言模型一样就 take in much context。

02:57:44 1

我们刚刚其实也讨论了一点数据问题,我想继续就这个话题再深入的讨论一下。你刚才说过你们其实 but 这算是真机数据是一部分是真机数据占很重要的一部分。是硅谷其他的这些 frontier lab,它们在数据的选择上有什么不一样吗?真机数据是一个共识吗?

02:58:07 2

我不太清楚别人有没有共识或者是怎么想的,我只能从我接触到的信息来看的话。比较明显的有一些人觉得我们可以把这个模拟系列的东西做的更好,做的更有用。我觉得这也是一个非常值得探索的区域。可能如果他们现在的工作重点是这个的话,他们可能就对春季数据没有相对而言没有那么看重了。

02:58:29 2

或者说也有一些人觉得我们就用一些人手直接说的,像这种 5 米的这个数据,就是人可以非常自然的在自己生存的这个空间中去说很多数据。而且它的效率就速度可能比你非要搞一个机器人进他们家,然后再说要轻松快一些。我觉得这也是大家不同的想法,就是它有一个重点。但是可能因为我是真机数据的信仰派,所以会觉得说以后肯定还是要真机数据。因为你都你都部署了,你可以说真机数据了,那为什么不用呢?所以我觉得对甄姬数据的如何用的更好的研究,应该是不会停止的。

02:59:04 1

当然我也觉得真机数据更实用。

02:59:06 2

我觉得就不光是实用,而且是最后当你真的做完了这个问题的时候,你机器人真的进到人家了以后,你就是会有很多真机数据了。

02:59:14 1

我相信这个是我们。

02:59:16 2

共同想要的一个未来,所以这个未来里就是会有很多终极数据的。

02:59:20 1

你觉得什么样的数据是好数据?现在这个定义也没有。

02:59:25 2

很很统一。对我觉得它不是一个学术能够清晰的解决的一个问题,我觉得是有一些不同的维度的。比如说这个数据它做的是什么任务?这个任务你看,如果我这个任务就是在空中再挥挥手,这可能就没有什么意思。但如果这个任务是跳舞,或者说随这个胳膊要怎么怎么动,它是一个更有意义的任务。所以我觉得这个是维度之一,就是任务本身或者说叠衣服、叠箱子还是拿水杯,这都是不同的类别的人物。

02:59:55 2

同时在做任务过程中,我觉得是有一个叫做动作的质量的这个可能就是如果机器人能做成这样,我不就觉得他做完他做的极端了,他这样的奥林匹克运动员那种表现就已经超越人体极限了。这个是有动作质量,你有可能收到一条质量不那么好的数据,可能就是为了拿这个杯子先晃晃悠悠,晃晃悠悠的再去拿,可能就没有那么好。所以这种动作质量也是一个维度。

03:00:20 2

同时我觉得就是动作的覆盖度,就从一个数据集,就刚才可能讲的是具体一条一两条数据。从一个数据集的角度上来说的话,你收了拿水杯的这个任务的那么多条数据,它的这个覆盖度到底有多少?它有多少不同的场景,它有多互相之间的不同。就比如说刚才说的泛化里的每一条维度,其实可能都是你说说出去的时候就可以考虑到的一个覆盖度的一个维度。

03:00:48 2

然后最后我觉得数据提供的是一种信息,如何能够在一团数据里挖掘更多的信息,包括不限于就是我收到了这个拿水杯的数据,我是怎么拿这个水杯的,这个水杯在哪儿?这水杯长什么样?其实它都是一个隐藏在里面的信息。如果我们有一些标签在这些信息之上的话,我们也可以就这些标签再进行一些学习。所以我觉得数据集它的标签标注也是非常重要的。

03:01:17 1

有一种说法是说通用大模型团队更关心在基础能力层面实现 ZA shot,就是零样本的放化疗。也就是在没有见过具体任务的情况下,他仍然能 work。而不是说我只要我见过这个。

03:01:31 2

数据我才知道。

03:01:32 1

而机器人或应用导向的团队往往更关注某个具体场景、具体本体、具体任务能不能跑通。这两类需求本身是完全不一样的。你同意。

03:01:44 2

这个观点吗?我觉得是相辅相成,确实这两个工作的重心可能乍一看没有什么关系,但我觉得互相之间是可以相辅相成。因为对怎么抽象的说呢?就是我觉得这些人在研究方面是有两个很大的主题的。一个就是它的表现究竟如何做到完美,还有一个就是如何在一个全新未知的领域下做出一个像模像样的东西。可能这就对应着你刚才所说的一个具体场景下的优化做到完美和一个 zero shot 0 样本泛化到一个全新环境。

03:02:25 2

而我在实际做的过程中,时常会感觉到,如果你能在一个场景中做得完满,你可能可以在其实更多的场景都达到更好的效果。这些东西都会帮助你做一个更高质量的模型。而更高质量的模型它不只是在你这两个任务上表现的更好,他在很多相关或者相似性的问题上他也会表现的更好。

03:02:50 1

具体的这种表现的更好是可以提升模型整体的能力的对。

03:02:54 2

这个是我比较坚信的。在这样的一个过程中,你可以说就是对具体任务的具体表现的研究,是可以可以受可以使这个大模型的整体研究受益。同时我觉得就大模型在新的任务,新的环境下的表现,如果能够稳步提升到一个差不多的情况的话,你也可以马上开始用一些更具体的提升手段。我觉得这两个就是互相之间,左脚踩右脚踩右脚,看看能不能上天。

03:03:26 1

这个是左脚和右脚一个通用的能力,而上能力一个是具体的任务。对,你觉得哪个脚可能现在跑得快一点?

03:03:35 2

我觉得像在派这样的公司还是很均衡的在发展的。因为它是一个非常本源的一个研究型公司,它是希望把研究路上的重要的问题都解决了。

03:03:47 1

怎么提高这种 zero shot 能力,因为具体场景可能是通过强化学习,技术上能力我觉得比较。

03:03:55 2

明显的一些回答可能是像架构架构研究预训练研究是很重要的,OK 同时数据也是很重要的。你可以看比如说像这些具体场景的数据,其实也是能够提升大模型独立的。

03:04:09 1

在架构上有人觉得下一代架构可能是世界模型。

03:04:13 2

我觉得现在世界模型也没有一个说法说它就一定长什么样。大家应该都是在探索,就不停的在探索架构到底该长什么样。

03:04:22 1

我每次聊机器人都觉得机器人还好早。

03:04:27 2

觉得离我们真正想造的这种星辰大海确实还有一些距离。但是能够每天每个月都感到一些稳步的提升,这种感觉,我觉得在做研究里其实很难得的。

03:04:42 1

你是哪一年加入的派?就是 25 年、24 年,24 年派,是 24 年 3 月创的。

03:04:47 2

我是三月跟他们聊吧,然后六月我毕业就去了。

03:04:52 1

你觉得 24 年和 25 年过去这两年,每一年在机器人领域最重要的提升是什么?我不好说在。

03:05:01 2

机器人领域的提升,我相信肯定有很多其实很重要工作,只是我现在不知道而已,很常见在研究中。只是我自己的体感的话,我确实觉得派的主要脉络从能力泛化到表现上来说,这条路每次我们走的时候都有一些新的发现,新的提升。是以前是对一些我觉得领域需要回答的关键问题给了一份第一版的答卷。我相信其实我们做了很多事情,也是会不停的在回顾,再进一步提升。我其实确实觉得有一些我们做的事情,也许已经有一些商业化的价值了。这个是以前的,我可能觉得还有些遥远,但现在感觉其实还挺近的。

03:05:45 1

比如说工厂。

03:05:46 2

这个倒不一定是工厂,工厂是一种可控环境的一个代表。就是因为你可以通过控制环境来让它更适配你现在能做到哪里。我觉得这是一个比较自然的一种应用场景。我不太清楚这里面的商业价究竟有多少,只是从表现的情况上来说的话,我觉得是有应用的可能性的。

03:06:04 1

有什么样的任务是 24 年初做不了,24 年底可以做的,25 年初做不了,25 年底可以做的。

03:06:11 2

我觉得 24 年初的时候,你跟别人说你要叠一个衣服,而且把他们还垒成一堆,而且这个衣服还因为衣服是你很难控制的一个东西。20 年初反正我当时觉得叠衣服是我非常想做的一个东西,但我是不知道能不能做出来。然后包括当时就搞箱子,还有甚至包括在那里做那个桌上清理,桌上清理是真的搞了很多,就是我们觉得他做不了东西,去试他究竟能不能做。当时就已经发现了,其实很多没见过的东西他也能做。所以当时就已经有很清晰的一种之前的不确定性,逐渐变成了一个看得到的成功。并不并不能说保证百分百成功,但是它是有成功的可能性,我觉得这个进步非常的重要。

03:06:51 2

然后 25 年首先我们自己做的是派 05 和派 06 的心,都是在 25 年做的。一个是进到 2B 地里去,一个是对具体的部署任务要求他的表现提升到一个纯靠数据很难达到的一个地方。我觉得都验证了一些。就不管是说你要多少个 ABNB 才能在下一个中得到一个好的初始成果,还是说你部署的时候到底能不能。因为我们是从一个很实用的角度来考虑问题的。

03:07:23 2

我们在比如说做 folding task,做这个叠衣服 task 中,我们不是说我们收了 10 小时的第一幅数据,然后就去硬做强化学习。我们是真的把这个东西做到了。我们觉得说数据已经就再说更多的数据都没得搞了的情况下才开始想说我们用这个强化学习的方法去搞,能不能再进一步?我觉得这个 frontier 是通过做这样的项目摸得更清楚了。

03:07:46 2

然后别的公司我觉得也有很多很有意思的事情。比如说之前看他们见面的的发布,就感觉他们的这种空间的理解和空间的认知。而且他们也不是一个单独的是 volek 模型,有的是一个更多模态大模型的一个能力。这种这种感受这种空间能力显然对于 robot x 是非常重要。其实他们现在没有一个特别特别的一个 task 来来展现他。我也相信他们将来可能会有一些发展。还有可能之前因为做强化学习也会关注一些非常具体的强化学习的项目。比如说别人都在用强化学习做一些什么非常具体的问题,就不管是在这个制造业,还有组装这些问题我觉得都是很有启发。

03:08:29 1

你对 2026 年在机器人领域的预期是什么?有什么可以值得。

03:08:34 2

期待的预期吗?我觉得肯定今年能有更多令人比较惊叹的 demo 出来。但是 demo 本身就是看是一回事,就是了解背后的到底是什么进步是另外一回事儿。我觉得今年肯定有,不管是人形来做操控性的任务,其实我觉得是挺成熟的一种可以看可以开始探索的一种应用了。然后其次就是在模型方面,我觉得模型架构应该大家都会有一些大的变化。

03:09:05 1

你觉得机器人领域应该跟自动驾驶领域去对标,还是应该跟大漠星灵去对标?

03:09:13 2

我觉得更像大模型,我其实觉得自动驾驶有比我们难有比我们简单的地方。比我们难的地方在于自动驾驶的 stick 它的潜在危害因子是很大的。如果你做出了一个决策,你那可是人命,是很严肃的一个问题。所以他对于表现完满的这个要求是极度的高。我觉得在我们这个领域,就我们日常生活的一些任务,或者说工厂任务的这种商业化道路上,我们其实都不需要那么一个级别的完美。所以我觉得这个是自动驾驶比我们要难得多的一个部分,他们是真的得有一个非常强有力的保证。而相对的我觉得他们比我们来说比较简单的部分。

03:10:02 2

你看自动驾驶的话,它这个控制器的问题其实是几乎没有的。就是我在这个车子上面跑,可能现在还有就跑一些雨雪天啊,这个路路道路泥泞,这种问题是一个控制系的一个底层控制问题。他们更多的问题都是在决策方面,就是你下面要怎么开。同时他们的决策的空间,我觉得相对而言复杂度要稍微小一些。不像你看我们在这个操作系的这个任务里面经常谈到的就是。我不仅要操纵这个多关节的一个比较复杂的机械臂去完成一个任务。它要达到这个我想它达到一个地方,这个就是一个操作器的问题了。已经就是你可能载重了以后,或者是摩擦力导致的,你可能不能完美的去贴合你想让他造的地方。

03:10:45 2

所以这种操作性问题是经比较难一点。同时它在决策方面的话,你要叠这个衣服,你这种手腕子转你到底怎么转,到底想怎么转,它有很多这种复杂的特别不一样的一些动作在里面,你都得能够搞定。所以我觉得这是它的难点和不难的点。

03:11:01 2

而跟大模型相比,我觉得大模型是它和我们异曲同工之妙。就是大模型它可以瞎说,他稍微犯错大家都很习惯了,你就是会胡说八道,对吧?我们不会全信你的。所以他的这个完满我觉得是不需要做的,像自动驾驶那么的严苛。

03:11:19 2

同时在这个探索方面,我觉得他们就是你看把他们当成一个智能体,他们的这个动作空间是输出每个字符,也可以输出一种策略。他们的动作空间也是一个高度抽象化的,所以需要很多多样性的一个动作空间。所以我觉得对于我们现在的机器人来说,我们是在两者之间的。但同时就是可能目前的发展阶段和大模型更加贴合一些。我觉得自动驾驶现在发展的挺好的,都已经跑上了。所以他们更多的就是在如何体会完美并且降低成本,尤其是在高度这种策略规划上面的问题,就是从 A 点到 B 点好像也不需要太多的说什么 C 点到 D 点就不行了。

03:12:03 1

这种机器人和自动驾驶谁是谁的自己?

03:12:06 2

在我看来这是一个比较平行化的问题。因为它只有两个问题的特性,就是以往的这种路径规划和控制的话,可能更贴合现在有某些自动驾驶公司的一个路径,可以看作是它它的一个应用。但现在因为我们已经不再用这种范式了,转到另外一种新的范式的探索。我觉得就有一点平行空间的感觉。

03:12:29 2

对,但是互相之间是能学习的,因为也有人在用机器学习做自动驾驶。我们也会从他的他的部署的体验中得到一些灵感。就比如说他们如果跑了这么多台车,然后拿到了这么一个数字,然后他们想要再提升安全性,他们是怎么做的?他们的一些基础架构,包括自动驾驶界,其实对于模拟器用的应该是很多的。而我们机器人,尤其是操纵器,还没有这么一个可以跟他对等的模拟器的出现。这个是不是有一些启示意义?

03:12:58 1

自动驾驶模拟器是谁在做?

03:13:00 2

我觉得首先几家公司,头部公司应该都有自己的模。同时也有那么一两家就是公开的专门做这个的公司,你可以就付费使用。

03:13:10 1

而且自动驾驶的数据量好大。是的,所有机器人公司都在争夺的一个北极星指标。是谁能够做出第一个出货的进入家庭的机器人,这是一个隐形的大家在争夺的方向。

03:13:22 2

我觉得是一个隐形的方向。因为家中的问题非常的多和复杂,所以如果你不你你你觉得你 last 了你的方向,你就想一想我们现在机器人还能不能做加重这个问题,应该有很多问题都是做不到的。怎么把它做到,就是一种很自然而然的一种想的研究的一种方法。

03:13:42 2

家中的问题还有好几个难的维度。我觉得第一个是它的环境的复杂性,就是确实是没有两个人的家和卧室是完全一样的。你必须要泛化性,过了一个很强的方法性的保障,才有可能到了一个新的卧室也能够。比如说我们之前做过一个叠被子,我们承认我们叠被子不是百分百,不是说你到一个新的家都能够蝶。这就是因为每一个新的环境的复杂度在那儿,同时就是家中的任务的动作复杂性很高,因为人在家中其实承担了这个家务。他的各种各样边边拐拐的东西,我觉得就是我列一箩筐可能都列不完就咱们在这坐谈个 2 个小时,可能都都没给他彻底给他写清楚。我们这些动作加上这个环境,就已经是给他从这个机器人表现方面提了很高的要求了。同时他还需要家用机器人。

03:14:33 2

如果做一个产品商业化来存在的话,它对于硬件的稳定性和人交互的安全性也是有很高的要求。就是硬件的话,我不知道现在有哪家公司的硬件是能够在一个人家里跑个一个月,而且不光是站着站一个月开机,而且是做了各种各样任务一个月。然后可能有一些,比如说我平时走路,有时候还会给桌子腿绊一下,就这些损伤他该怎么样去承担去稳定。并且如果你在一个人的环境中和人互动的话,也有很多危险。

03:15:07 2

或者说你这个可能就是我看特斯拉 optimus 擎天柱,我看到最害怕就是他要是在我家里摔了,我该花多少钱修我家地板?或者他摔在我身上,我岂不是就是那个什么了,我我我好害怕。所以看到这样的话,我就会觉得其实我们距离一个优秀的 form factor,一个真正的巨神,可以在人身边工作的剧神。

03:15:30 1

还是有一点距离。你是不是长得小一点比较好?

03:15:34 2

我觉得小就是比如说像李树的这种机关的这个就小孩一样的身高,确实就是给我一种他没有那么大的威胁性,然后可能他也轻一点儿,就轻就是整个机子轻了以后,他能做的事情还耗电量,还包括安全性,我觉得都是瞬间就有很大提升。但是小的话,其实他们也会有一些其他的问题。比如说他这个人情的一个很大的说法,就是说你人可以做的事情,其实小了以后你有些人做事情你就做不了了。那你还怎么用这些人的数据也是另外一个话题了。

03:16:04 1

可能你看今年的春晚语速非常的火,中国的机器人非常火。你在大洋彼岸怎么看中国的机器人的发展?你觉得它跟美国的趋势相同。

03:16:16 2

和不同是什么?你觉得在一两年前想看到这种级别的 demo 就只是想想而已。能看到它,真的把它做出来还是非常激动的。我觉得他能够做出来就是有算法提升,也有硬件实力在里头。我觉得这种硬件实力可能是现阶段看中美的产业对比的话,最直观的感到中国在这上面是有领导力统治力的。就是很难想象有一家机器人公司,它组装好一台机器人,这里面没有一个零件是中国的,我觉得是不太可能真的。我觉得中国的产业链制造业的这个优势实在是太大,而且到现在我都不知道美国人要是追的话该怎么追。同时就是因为这个硬件迭代,就可能他拿着现有的算法,距离商业落地端已经有就也是有一些优势的。

03:17:08 1

还有什么不同吗?或者相同,我觉得像派这样。

03:17:11 2

公司还是比较独特的。我都不好说它是一个中美的不同还是怎么,它是一个很偏向研究的一家公司,暂时情况下我们应该是完全不考虑商业化,因为觉得那可能是一个 struction 分析,这个其实也是有一些历史原因。

03:17:28 1

我不知道历史原因是什么。

03:17:31 2

Peter appeal,他不是 sergi line 的导师。Peter appeal 他是有过两次创业经历的。一次他非常成功的做了一个给学生作业打分的一个,现在基本美国大学都在用,我上大学也用这套系统。然后同时他还创立了一家机器人创业公司叫口碑。他在 2015 年还是 16 年就创立了这么一个公司,说要做机器人的通用的机器学习的一套方案。而他们公司在发展过程中,可能在某个时间点开始就比较深耕这个物流、仓储、机器人。

03:18:06 2

从大模型开发的角度上来看,从回头来看会觉得这其实是对他们开发大模型的一个分析。就是因为这个投入虽然肯定是做出了很多成果,但是在大模型这边就觉得是因为过早的去商业化,而失去了这种通用泛化性。反而把精力放在了很多这种商业化的相关事情上,没有真的去追溯本源的问题。所以派我觉得是有受到这段经历的影响,就是比较的强调说我们不要太想这种商业化的事情,不要为了挣钱,或者说去把这个商业闭环打通,去做很多可以可能说对研究没有帮助的事情。大家还是很纯粹的说,我们要做一个研究,把它表现做的最好。上年华的事情可以后面再想。我觉得这个和我听说的一些中国公司的逻辑是不太一样的。就是中国公司可能从这商业逻辑上来说,更强调实用主义和商业的这个绘本。

03:19:03 1

但即使在美国对派单的公司在硬件上投入不够。

03:19:08 2

或者在硬件。

03:19:09 1

上没有优势的话,长期来看会不会成为一个问题?

03:19:13 2

我觉得这看你是怎么理解硬件的投入和表现的。我觉得我们没有无限的钱,所以我们在每个方面都投入不够。你知道 OpenAI 他现在融了多少钱吗?我们每天看这个钱就觉得好眼红。我们也想有这么多的投入,我们有这么多投入以后,我们的软件变得更好,算法变得更好,算力变得更好,数据变得更好,哪儿都好。所以不够是没有止境的,我觉得都可以投更多。

03:19:39 2

相对而言的话,可能就是现在的产业优势在硬件方面,是在中国它有很强大的供应链,你可以定制一个机器人,它有很多的电机的选择,机器人的形态选择,都是有比较成熟的一个方案的,所以这个是它的优势。我觉得大家其实也都有在看,就怎么样弄一个最适合自己的机器人的硬件。我觉得这其实大家都在做,只是因为缺少了产业链制造业的这一环。可能在做的过程中它的迭代速度会变慢,或者有些事情可能如果你做的更快,有更多就是可供你取舍的机器也会不一样。我觉得这个确实是对迭代的研究的迭代速度肯定是会产生影响。

03:20:21 2

但同时另外一方面,硬件毕竟不是一个解决的问题,就它是一个相对而言可能没有软件那么严重的问题。因为现在你搭一个硬件是可以搭起来的,你想要做一件有意义的事很难,所以这是软件的最大的问题。而硬件的话属于你搭起来是可以搭起来,动也可以动。但是不是说你已经把硬件做完了,就还是有发展的空间。我觉得这个其实创新永远是未知数。你不知道有没有可能他做出了一个很简单的一种硬件,它非常适合现在的算法。没人说得清。

03:20:54 1

觉得硬件的劣势更好抹平,还是软件的劣势更好抹平。

03:20:57 2

过去几年的发展来看都好么?平大家永远都是在这,对中国。

03:21:02 1

团队来说,他其实 follow 派就好了。因为你们很多论文都是公开的。

03:21:09 2

是的,我觉得我们有很多论文是公开的。

03:21:11 1

google 不一定是公开的,对吧?Test 了不一定是公开的。

03:21:14 2

但是他们可以暴露你们 google。就算公开了,你想追上 google,你还得先睡一个像界面的这样尺寸的大模型出来,这已经是一个包。我觉得同样的逻辑也适用于像派这样的公司。随着公司不断的积累,他最后就算告诉他怎么做的,你不一定有那么多东西可以尝,可以去可以去给他 match 上。但是竞争永远都是存在的,我相信肯定就还是有人能够给他 match 上。然后硬件方面的话,我觉得其实你看美国现在的产业链,你会觉得这个硬件简直就是不知道该怎么说了,你只能寄希望于创新了。

03:21:48 1

你们公司其他人会很关注中国机器人的发展吗?

03:21:51 2

我觉得都很关注,这是一个不可忽视的一个部分。

03:21:54 1

像比如说你们最近会讨论关于中国的什么话题呢?

03:21:57 2

比如说语数春晚那个表演,我们就在这个公司的群里面发了,大家就会讨论说这个东西可能是怎么做的。甚至最近的读书会,我还想说要不要请一些这方面的专家的朋友来给我们讲一讲。因为我们不怎么做人形,也不怎么做这个 local motion。问题也可以请他来教一教我们这些东西里面发展是怎么样的。我觉得这些都是大家会不停的去看到更新更好的东西,然后去学习,去看看有没有启发,可不可以用到我们现在做的事情上面。不管是拍还是其他公司应该。

03:22:27 1

都是一样的。他们是怎么做的?你们从外部视角。

03:22:31 2

看他们是怎么做的吗?确实最近有几篇新的论文出来,可能可以解释他们的一些做法。我不知道你知不知道,石冠亚是一个 CMU 的教授,他之前在华大读博士后的时候,和他成为了朋友,从他身上学到了很多 local motion 的一些东西。他们组织已经发了这个 omi target。

03:22:52 2

我们可以从早期发展稍微梳理一下。大概是在 1819 年的那会儿,我稍微关注过一下他们是怎么做的。很多时候是希望他走路,然后走路可能有一个步态,所以你就是把它分成也可以可以简单粗暴地分为一个 high level。高层的告诉你我大概想让你变成这个样子和 low level 去执行。我怎么样变成这个样子步态的话,可以是一个走路,可以是一个红红翻,可以是一个跳舞。而执行端的话它以前可能就是不停的去控制,现在的话可能可以配合强化学习来达到你想要的这个步态。

03:23:27 1

强化学习很重要,强化学习在 local.

03:23:30 2

模型界确实取得了相当大的成功。你觉得。

03:23:34 1

美国对于硬件的投入够吗?重视度够吗?我觉得很多在美国。

03:23:40 2

的从业人员应该都会同意说我们的硬件还有很大改进空间。

03:23:46 1

那特斯拉是怎么做到的呢?

03:23:49 2

特斯拉首先它很神秘,我们其实并不清楚它的硬件里面的技术细节,他不会和我们说这些事情。

03:23:58 1

你说的是机器人是吧?对他车他还有车,就是他在美国硬件做的很好,而且好像有一个笑话。

03:24:04 2

我不知道是不是真的只是一个笑话,说特斯拉最牛逼的工厂是在上海开的,产量就是高。相对而言确实它是已经有一部分制造业的。我觉得这个和这和美国教育体系也是有关系的。你看他的教育里面的专业和就业途径,它这个产业的以往的缺失,也导致了它这个专业就不会火,没有那么多人学,那就缺失了一批人才。那它怎么样去弥补这个事情是很难的,不是一两年就可以投入回去的。我觉得他现在可能更多的是指望说很多移民是有这些类似的技能。他毕竟是一个移民国家,可不可以通过引进这些缺失的人才补上一些产业链。但美国这地方就是修个地铁站都得修了这么多年,他究竟能做成什么事情,我们也不好判断。

03:24:51 1

你觉得人工智能最后会拥有意识吗?机器人会拥有意识吗?

03:24:55 2

好抽象的一个命题。你知道每次当我看到什么,有一个机器人他的意识觉醒了,他要毁灭人类。我都想说这也真的很希望有人给我解释一下意识是怎么诞生的。因为我们只是一些生物学小白,但是会去听一些这种科普,就非常想搞明白怎么样就从一些物理、化学这堆东西里面,突然就诞生了意识这么一个我都不知道它是怎么代表出来的一个东西。我觉得如果我们认为机器人产生的意识是像人类这样的意识的话,我其实有点悲观的。我想说就是这真的有可能吗?但是如果你把意识定义的很宽泛,就比如说我现在跟 AI 聊聊天,他给我的感觉是他像个人他就够了的话,那你也不能说他没有意识。但是也许在将来大家可能更期待是一种,我也不知道它太智能了,所以它显得像有意识,就真的是对我来说讲不清的一个话题,暂时是科幻小说非常好的一个素材。

03:26:00 1

机器人种族会是什么样的?

03:26:02 2

我觉得机器人种族可有意思,我其实一直很想做的就是机器人可以造自己,我觉得这个是机器人发展的一个可能会是一个里程碑。因为它就像一个种族,是有延续性的,是可以通过自我的一种繁殖。我觉得机器人能够组装造自己就是一种繁殖的体现。所以这也是我非常想做的一个课题。也是我当时去找教主的时候,我就说我是非常想做这件事情的。

03:26:27 2

机器人的种族我觉得第一我非常喜欢,就是机器人哪里坏了就可以修。你看我之前这个攀岩摔了以后,就是因为某一个部位受伤,就得在家呆着很久,而机器人就可以换掉呗,换掉然后可以拆,然后可以改变形态。我觉得这是一种非常自由自在的一种存在方式。然后机器人想咋样就咋样。

03:26:49 1

对,想咋样就咋样。甚至你可以。

03:26:51 2

就是像特修斯的船,那个希腊故事一样,我把这个机器人从头到脚都换成了另外一个零件,甚至模型也可以换。还是原来那个器人。其实在我们公司的发展过程中,就是有这种,本来是有编号的,这是一个机器人,它的编号是这个。然后通过不断的修和改,他已经完全不是原来那个他了。他好像跟原来他的唯一联系就是他们编号是一样的,但其实里头全都换掉了。我们就说我要不要给它起一个新的名字?不然好好复杂。还经常要说这个机器人在某个时间点前是这么个东西,后面是这么个东西。

03:27:26 2

机器人种族我觉得也许是会成为机器人种族的一个伦理的。就是之前什么我的上一辈做的这个事情跟我没有关系,因为我们已经从头到脚都没有一个零件是一样的机器人了。然后这个伦理审查委员会就来看这个机器人是不是真的从头到脚里面每一个零件都是换新了的。

03:27:44 1

你觉得机器人种族是人族的延续吗?机器人会是人类做最后一件事情吗?

03:27:52 2

最后一件事情,我确实希望我们做的很多事情是可以提升生产力,使得你可以做到很多原来需要人做的事情,然后你一个人就可以做。但是我相信人类的创造力是无穷的。我不觉得我们活着是为了提升生产力,我觉得我们活着更多的是爱与死。是文学作品中永恒的话题。我觉得即使是在一个生产力高度发达的年代,应该也有人想要做一些不一样的东西,想去探索一个还没有做出来东西该怎么做。所以我不觉得机器人会是最后一个造物。但是延续我确实觉得一个比较浪漫的想法是,虽然我们生命是很短暂的,只有 100 年,放在就人类历史,放在宇宙历史上就是微小到不值得一提。但是是不是有可能造出一个东西,它可以看到宇宙的尽头,看到宇宙的尽头。

03:28:51 1

我不知道这个。

03:28:52 2

时间跨度是多大,但是可能我们活。

03:28:57 1

不到那个时候了。这种方法机器学习这种方法来训练机器人。因为你也说到它跟上一代人非常的不一样,它是一个黑盒。你觉得在这种训练机器人价值观背后,让你对与人和机器人有什么新的感悟没有?它是黑盒。

03:29:14 2

但是它因为是从一个数据出来的东西,它是有限制。它是 bounded by the objective that you define,它是一个很数学化的一个东西,所以它虽然是一个预期的,对它是一个构成无法理解的黑盒,但是它是在数学角度上可以解释的一个东西。我觉得在训练机器人的过程中有什么感悟的话,可能一方面就是一方面会觉得。确实就是能够发挥我这个特别想偷懒的天性。如果一件事情可以让机器人来带我做,我会想方设法让其他机器人来帮我做,这不就挺好的。就是你有个智能体,它一直还没有到完全体,他已经可以做一些事情。我就想办法要把这个事情给利用起来,来提升我的生产力,可以让我少干点活。我觉得这个是我对于人类文明的偷懒。我我我甚至可以暴论一下,是不是偷懒就是人类文明一个本质的追求,就提升生产力和偷懒是一个东西。

03:30:16 2

然后其他的话我觉得在很多时候,在我现在的工作中是没有什么人文的存在。或者说因为我每天讲的是一些非常物理化的科幻化的一个东西,我也会感觉我会和一些其他搞人文的,小说创作、艺术创作一些朋友聊天。他们也会很好奇问问这个机器人的的进展,我也会很自己作为一个用户的好奇。是不是有一天我们创造出了这些智能体,它也能够进行某种意义上来说超越他的就是离开了他的创作者,就是我们的一些创作。

03:30:52 1

那一天会发生什么?

03:30:56 2

我不知道。也许他会搞一个二维码,然后他们每个人都觉得二每个机器人都觉得这个二维码美极了。然后你在这里看了以后就有一种不明所以的感觉。当机器人。

03:31:08 1

有一天实现了,你准备去干嘛?

03:31:12 2

实现了写小说吧,回家写小说,做一个游戏,创造一个非常能贴合我的喜好的一个故事,把它分享给别人,看看有没有其他人喜欢这个东西。诺贝尔文学奖看看冲击一下。你现在脑子里有这样的。

03:31:33 1

一个故事吗?我觉得构思小说。

03:31:36 2

确实是一直没有停止过的,写不写出来是另外一回事儿,拖更是经常有的。但是就构思一些故事,不管是和我们现在生活非常贴切,还是说非常天马行空的想象力。真的机器人解决以后的社会形态是一直都有存在的,就包括生产力极大的爆炸以后,一个人就假设在现在这个年代就有生产力极大爆炸的话,那确实就可能家里就终于不用被前来看望的爸妈吐槽,说你家里怎么这么乱,这么脏。就可以不想干的事情都可以丢给别人干,丢给别的机器人去干。然后也可能会比如说现在在艺术创作中,比如说朋友会去做一些小手工艺品,我觉得可能就更多的是你有这个概念,然后你可以把这些执行端的事情全部交给机器人来完成,我觉得这些也是一个方向。然后可能更远一些的生产力爆炸,可能有个资源以后自己可以造一个城堡,就打到哪个乡村去隐居。你看网上有一些古堡拍卖,才几万美金,这个就可以买一个什么 200 年没有修过的古堡。你现在没有人买是因为太太麻烦了,要修要找很多专业。

03:32:51 2

我觉得就是有一个很有意思的特点,可能是现代社会里面很多工种是一个特殊的工种。你花了很多你作为人的这个时间去锻炼一个技能,然后你有很多的知识。但机器人或者人工智能,它作为一个大模型或者通用的一个东西了,它是可以随时的切换。比如说将来可能修房子,就真的就是有两个修房子机器人,他们什么都能做,让他们可以互相配合,就把现在需要找不同工种能完成的这个事情被干掉了。

03:33:17 2

可能我们现在做研究也是有一点类似的。你以前可能做研究要找一个专门的 A 负责这个东西,他可能有些洞察力,但你现在就问同一个模型它可以达到。所以我觉得将来如果每个人都有可支配的一些这种通用生产力,而且每一个具体的任务它又都是专家级别的话,那就是真的能够到达生产力爆炸,能够做很多,现在想都不敢想的一些事情。可以创造更好的游戏和小说喽。

03:33:44 1

你喜欢的小说的世界观是什么样的?

03:33:47 2

有两类。第一类是在一个完全不同的科幻环境下探索的一些人员之间的关系。第二类是一个拿着一个魔幻的题材,但是把它放到了我们现代的生活之中。举个例子的话,可能第一类之前看过一个修真小说,但是是在宇宙里搞科技发展,就很抽象。这个命题就讲出来我都觉得好像很乱七八糟的样子。但他其实探索的其实是一个女主角作为这个穿越者来到了这么一个未来的世界,感受到这未来世界的这个社会制度以后,想要改变这个制度,他做了很多事情,我觉得这个是和我们非常遥远。但是在未来也许是有一天某一个人就会有这样的一种 struggle,一种困境,一种英雄的旅程。什么样的社会制度。

03:34:39 1

把它改写成什么样的社会制度?

03:34:42 2

在他那个社会制度里,他有很多性别对立的元素存在,就是男性和女性的分工完全不一样。女性的分工是因为他们所拥有的一些天生就有一个自己的一个宇宙空间,所以他们被塑造成了一种类似看起来似乎是女尊的那种世界里。但实际上女主不觉得这是一个好的世界,毕竟她也是从我们这个世界出去,她可能天山就不认同这种世界观,但在那个已经成型的社会观里面,每个人生来要做什么事情都是从小到大的细节教育观点。社会塑造非常强烈的。他想要反抗这样的社会塑造,他想要创造一个大家就可以自由选择的一种东西。他在这里如何召集盟友,就是让大家愿意追随他和他一起做这个事业,是一个很有意思的旅程。

03:35:33 2

然后另外一些的话就是就类似的这种科幻小说,我看的还挺多的,就是非常喜欢这种。然后另外一类的话,我觉得就是说魔幻主义,比如说看这个现代社会打工人怎么又兼职武林盟主,就是有一种两种完全不同的世界观的碰撞。一方面是一个你生活息息相关的,好的地方你都能理解,痛的地方你也能感受到。另外一方面是一个你可能小时候会非常喜欢的那种跟我们八竿打不着的一种完全不同的世界。但是在一部作品里面把两部世界融合在一起,让你感受到他们之间的一些共通性,还是挺有意思的。比如说我之前因为经常打游戏打网游,然后网游里面可能是需要组队的,就担任了一份一段时间的队长,去负责组队、沟通,还有处理一些鸡毛蒜皮的事情。或者说团队的时候进度遇到了问题,你需要去安抚,或者说给大家打鸡血,这其实跟现在公司的这些项目管理是有非常多异曲同工之妙的。

03:36:34 1

你是虚无主义的。

03:36:36 2

信仰者吗?我觉得怎么。

03:36:39 1

理解虚无主义?

03:36:41 2

我觉得我很难再看到一个具体的意义的陈述的时候认同他。人活着是为了什么?我觉得是一个无解的命题。所以当别人可能会试图说服我说某个东西很有意义的时候,我要是想要打破砂锅问到底,我就会能够得出一个结论,就是其实没有什么意义。所以这是我虚无主义的一个部分。

03:37:02 1

那人活着的意义是什么呢?

03:37:04 2

就没有意义。我觉得不需要回答这个问题。

03:37:07 1

他每天激励你过每一天的内心的动力是什么?

03:37:11 2

我觉得从某个意义上来说,我是很幸福的。因为我在做自己最想做的事情。

03:37:17 1

所以你是没有预期,也没有目标。

03:37:20 2

我还挺喜欢乔布斯之前的讲话,人生有可能是有很多点,当你在走过的时候,他们看上去毫不相关,但也许有一天它们是可以连起来的线。我并不觉得我走的每一个点需要一个马上就能阐述的清楚的目标来驱动,但是在某种意义上来说,现在我的人生的途径走到今天,已经能看出一些奇奇怪怪的点,连成了一条线,形成了我这个人的历程。

03:37:55 1

你能对未来有某些点的预测吗?

03:37:58 2

点的预测。

03:38:00 1

就未来时空的一些可能性的预测。

03:38:04 2

我的这个人的点的预测,我就非常想做一些我比较感兴趣的课题,并且希望把它们做成一个五年前我想都不敢想的东西。我觉得如果能做到这个,我会非常快乐。所以这是我在接下来 5 到 10 年的一个期望,也有可能就是技术发展的非常快,我也想开始做一些更加落地的项目,因为觉得这个东西好玩,我觉得预期是无穷的。但是最后随着时间的推演,你会把这些东西收敛到一个更加确定的道路上。所以我很难现在给你一个我以后要去做这个,反而就说如果做这个就会很好,这种思想是更多的,就是在工作中我们是非常确定的下。

03:38:46 1

步做这个。我们进入最后的一些问题,我们会请每一位嘉宾推荐一本人生之书。要真的对你的人生有过非常重要的影响,你会推荐哪一个?

03:39:01 2

觉得有非常多的书都影响到了我,但是现在可能偶尔会思考的,这本是 distinct。Construction social taste,它是一个法国哲学家写的一本关于这个社会的阶层和每个阶层的喜好,就包括人生活中的衣食住行方方面面,他认为是有很多是经由现在的社会所塑造的。我为什么推荐这本书?是因为我觉得就是通过看这本书,让我对于我所喜好的一些东西和我有多少喜欢是我自己喜欢,有多少喜欢是社会的塑造的喜欢产生了更多的认知。

03:39:49 2

而在现在这个社会,在硅谷我觉得是充斥着一种对于生产力的崇拜的。也许我们没有这个书中所描写的那个社会的那种旧式贵族的打这个球、骑这个马,是一种更高贵的运动。在那个年代他们可能会追求一些我们现在不太认同的就是价值观,什么是更好,什么是更什么是没有那么好。但我们现在其实我觉得也是有一种新的价值观,甚至我觉得这个价值观也只是一个变化中的缩影。我觉得这是我的人文主义的东西在告诉我,虽然我是在工作中这么热衷的去优化生产力,虽然整个硅谷他已经放弃了什么。对衣服、对穿着的这些讲究,它讲究的是什么效率,讲究的是精简,讲究的是创造。它何尝不是这个社会价值观的。

03:40:46 1

一个部分?你小时候想离开家乡,想远离家乡。

03:40:52 2

然后我就是非常好奇外面的世界,有什么来到外面的世界。

03:40:57 1

在今天此刻你在硅谷,因为现在硅谷其实是同质化的,它是高度竞争的,高度竞争的是你有什么想反抗的吗?

03:41:08 2

我时常觉得这是一个很有意思的点。小时候搞竞赛,会学到一些算法。贪心算法和动态规划算法是两个常被放在一起比较的东西。贪心算法就是说我在每一个时间点上,我都要做最优化的一个决策,我要做当下的最好。而动态规划算法就会告诉你就是如果你有一些全局的视角,你就会发现每一步都做最好的决策,并不能让你达到全局的最优解。

03:41:40 2

我是非常的喜欢这个逻辑的信息了。所以很多时候我觉得就像塞翁失马焉知祸福。一时的成功失败,还有优化,还有没有做到极致,其实并不能代表着长期最后的结果。毕竟我们没有一个人有着全能全知的视角。所以即使是在追求优化的道路上,我有的时候觉得就做九分留一分是可以的。而我自己的这种求学路程,各种各样的东西,可能也在很多人看来就是从来不把事情做到最后。

03:42:20 2

我觉得也许机器人会是我第一次觉得我们得把这个事情做到最后。但之前的那么多没有做到最后的东西,才让我走上了今天这条路。我觉得这个和硅谷这种很多时候很多人都是从很早之前就走上了同一条路,一直在上面竞争,是有一些本质性的不太一样的。

03:42:38 1

一个全球范围内你喜欢的食物,我们是手段。我们希望在这个人工智能快要来的时候,留下一些人类的日常生活的印记。一个全球范围内。

03:42:55 2

你喜欢的地点吗?我非常喜欢爱丁堡,这是我在英国留学的短暂的半年里应该是最喜欢的城市了。以前的我因为比较喜欢一个人待着,而且其实现在大都市很多时候是一样的,就没有那么的感受到我走入了一个完全不同的物理空间,我整个人的状态都会发生如此大的改变。

03:43:17 2

因为爱丁堡这个城市有非常多的古建筑,也保存的非常好,并且它也没有那么多大都市的那种喧嚣感。他甚至有点像旅游城市,大家都是去看那个古堡的。但是在那种城市有一种慢下来的感觉,有一种思考。人就是历史这么沉重的一个东西放在你的眼前,然后你在这个转瞬的一瞬间,你想做一个非常大的一个动态的一个变化。但是就在这些沉重历史面前,这个动态的变化究竟最后会去哪里,你是不知道的。只是站在沉重这里,在只是站在这个历史的以及这个地方,能感到一种是一种很安稳的感觉。所以是我非常喜欢的一个地点。

03:43:58 1

一个少有人知道,但是非常重要。

03:44:02 2

的知识点。我可以讲一些谁与知识相关的吗?

03:44:09 1

可以。对。

03:44:10 2

这个是我上大学的时候和朋友聊天才发现的。女性朋友们可能有一些误解,觉得有一个叫处女膜这个东西,他会在第一次的时候会破裂,会流血,就变成了一个大家非常相信的一个真理了。但其实在医学方面,它是有一个医学的名称叫做阴道瓣。它并不是意味着你的这个第一次体验也不并不一定会流血。这是一个我当时和朋友沟通,我们也是恶补了一下这些生理知识,才发现我们对于自己的身体构造有着这么多的缺失。

03:44:54 1

在你看来影响机器人进程的论文。

03:45:00 2

好多论文切 GPT 也极大的影响了机器人的进程。真的有太多的,我觉得很难就是一个。我觉得从术发展上来看的话,最近影响很多,就包括这一代模型的电机。比如说像 difficult policy 这种就扩散式的,还有之前就是 transformer ACT 这样子开始用这个 transformer 架构做。还有包括更早,我觉得有很多对模仿学习和强化学习的本源性研究都研究都影响到了。就是现在大家在做什么。

03:45:33 1

基于你当下的认知,一个关键的重要。

03:45:36 2

的 bat 是什么?我觉得其实我们进入家中不一定是以产品的形式,就是更多一些探索形式,没有那么的远。

03:45:47 1

你说机器人进入家中。

03:45:49 2

对比我一开始想象的可能要近一些。

03:45:53 1

我们工作室叫语言及世界工作室。当你第一次听到这个名字的时候,你在想什么?

03:46:00 2

语言及世界我可能下意识的就是把它诠释成了语言就是全世界。然后我就会有一些跳跃的想到,这不就是缸中之脑?就是咱们其实生活在一个有所有感官连接的一个东西,就是你你所有感官就掌控着你对这个所世界所有的认知。完全可以想象我们活在一个巨大的模拟器里面,你的眼睛、鼻子、耳朵都是插了一个信号源的,这个信号源想给你输什么就输什么。因为现在研究期间研究期的话大家会说大语言模型,它是一个纯语言交互的。就之前的那那代纯语言交互的话,它是不是不能理解真实世界,不能够把它所听到的一个概念而放到真实世界中,也是一个水杯。这个水杯其实有很多物理性质都不能够 capture,不能够去捕捉,不能用言语去描述。我觉得也是这样的反思,变相促成了多模态的研究。

03:46:56 1

所以我们生活在一个巨大的模拟器里面。

03:47:00 2

如果模拟器就是世界的话,那好像馍不模拟没有什么差别。唯心主义 will explore the new world。

03:47:32 1

好了,今天的节目就是这样。这里是商业访谈录,是一档由语言及世界工作室出品的深度访谈节目。你可以到公众号关注我们的工作室,获取更多的信息。我们的公众号是语言及世界,language is world. 也欢迎你在小宇宙的评论区与我们有更多的互动,我们希望和你一起从这里探索新的世界。

Click any line to jump · Hover to ask AI

Content Overview

对话深入探讨了中美在机器人技术发展上的差异,中国在硬件供应链上的优势与美国在软件算法上的竞争力并存。讨论涵盖了机器人技术的关键议题,包括数据量、算力、强化学习、硬件创新、商业化策略及伦理问题。双方均认为,机器人技术正朝着通用化与商业化迈进,但面临安全性和环境适应性的挑战。未来,机器人领域将更加注重技术与人文关怀的平衡,探索机器人意识与伦理的哲学思考,以及机器人技术对社会形态的潜在影响。

#### Speaker Summaries

发言人1

介绍了硅谷机器人公司 Physical Intelligence 的研究员科林·一鸣,强调了其在机器人大脑研究领域的专长,公司估值超 50 亿美元,被视为机器人领域的 OpenAI。一鸣在强化学习方面有深厚研究,同时业余时间创作小说,探索机器人与人文的交汇点。他分享了机器人行业的发展历程,指出机器人未来构型将呈现多样化而非统一化,且在软件与硬件优化上将持续探索。一鸣强调真机数据的重要性,讨论了强化学习在机器人领域的应用,以及机器人可能具备的独立意识。他还对未来世界进行了预测,并推荐了人生之书,展现了科技与人文深度结合的独特见解。

发言人2

他认为人类创造力无穷,活着更多是为了爱与探索而非仅提升生产力,期待机器人能探索未竟之事,追求用机器人提升效率并享受“偷懒”。他好奇艺术与人文,设想机器人能创作小说、游戏,甚至冲击诺贝尔文学奖,对社会制度与人性有深刻思考,喜欢科幻与魔幻结合的作品。他强调多模态研究,认为语言模型应理解真实世界,重视自然语言与智能体交流的天然性,认为 VLA 模型探索空间广阔。他描述了公司自由的工作氛围和自发的加班文化,强调团队合作与个人成长,讨论了强化学习在机器人领域的应用,指出探索、归因和任务定义是关键。他分享了筷子机器人项目经历,展示了如何通过模仿学习和强化学习,让机器人完成精细操作,如夹取小球。他强调机器人自组装能力的重要性,视之为机器人发展的重要里程碑,展望了通用大模型的开发和机器人在日常生活中的广泛应用,对机器人技术可能带来的社会影响进行了反思,表达了对技术实用主义的信仰和机器人技术能够帮助普通人完成任务的愿景。

机器人 人工智能 强化学习 小说 生产力 洞穴 cloud code 信息爆炸 独狼玩家 田园牧歌 智能体 人类 恋爱 二次元 毁灭世界 医疗 权限 任务 责任 信任

Content Overview

!Image 2

今天的嘉宾是硅谷机器人公司Physical Intelligence(Pi)的研究员柯丽一鸣(Kay Ke)。 Pi是一家专注于研究机器人“大脑”的明星创业公司——成立仅两年,投后估值已超50亿美元,是这个赛道最受瞩目的独角兽之一。部分业界人士对它的期望是,成为机器人领域的OpenAI。

柯丽一鸣在Pi主要负责强化学习方向的研究,也是Pi核心论文的作者之一。

在科研之余,她追求在工作和人文表达之间找到平衡,所以业余时间她也会写写小说。这让今天的聊天更有意思了。 节目中,我们详细聊了聊机器人的江湖、谱系、门派与主角们。 全球的机器人团队都非常关注Pi在机器人大脑上的开源工作。柯丽一鸣详细阐述了他们的研究思路与技术细节(从π0到π0.5再到π*0.6)。

但由于我们这集节目的录制时间比较早,尚且没有囊括他们的最新模型π0.7。嘉宾关于π0.7的技术讲解,我会补充在shownotes里。

接下来,就是我对柯丽一鸣的访谈。 OUTLINE: 00:02:11 机器人与小说家 00:17:26 武侠、板寸、背包客 00:36:33 草蛇灰线 00:53:56 机器人江湖、族谱、主角 01:27:18 硅谷创业图谱 01:54:43 PI的研究:π0、π0.5、π*0.6

*嘉宾补充:π0.7强调统一模型,不需要后训练,就能媲美以往后训练的通用能力。有架构和数据(有不少之前自主rollout数据)的设计。 02:26:01 PI的组织与文化 02:34:52 放弃剑桥教职 02:46:49 巴甫洛夫的狗 03:04:53 前沿展望 03:16:14 中国 03:25:02 机器人“种族” 03:31:19 没有写完的故事 LINKS:

我们的播客在小宇宙Apple Podcast、Spotify等全音频平台播出;

我们的视频播客在Bilibili小红书、视频号、抖音等全视频平台播出;

如果你想服用文字版,请搜索我们工作室的公众号:语言即世界language is world。 DISCLAIMER:本内容不作为投资建议。 CONTACT:xiaojunzhang@lisw.ai Jump into the new world-and explore with us!😉

Make your daily reading actually fit you.A daily brief built from the sources you follow. Get started free

00:00 / 00:00

查看原文 → 發佈: 2026-07-16 08:30:00 收錄: 2026-07-16 12:00:53

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。