PODCAST
90
A deep conversation with Apodex's Chief Scientist, deconstructing the technical path, core bottlenecks, and the future of recursive self-improvement in AI, exploring how AI can acquire the taste of a scientist to solve unsolved human problems. 硅 硅谷101
Today 01:10:54 17 chapters View Source →
00:00 00:00
00:01 1
Hello, 大家好,欢迎收听硅谷 101,我是红军。最近 anthropic 他承认了一件事儿,他们现在 80%的代码已经不是人写的,是 cloud 自己写的。这家全世界最谨慎的 AI 公司同时发出了一个警告,AI 可能很快就要自己设计,自己去训练下一代的 AI 了。他们管这个叫做递归自我提升,英文是 RSI,也是硅谷今年对模型能力最热的讨论方向之一。
00:36 1
今天这期节目我们的含金量高了,我们请到了两位真正正在做这件事情的研究员。他们所在的公司叫做 apple dex 背后是陈天桥出资创立并亲自主导的那这家公司给自己的定位也非常的特别,他们不做图片生成,不做视频生成,只做一件事儿。他们自己叫做 y duty server,意思是专啃那些没有标准答案,人类自己都不知道从哪下手的难题。他们管自己想做的模型叫做 discovery model,不是从已知的信息里面找答案,而是要提出人类还没有想到过的假设,然后自己想办法去验证它,去解决这个世界上还没有被解决的科学难题,这也是为什么这家公司叫 apple dex,因为词源就是希腊语里的证明和论证,如果 AI 真的可以教自己,人类科学家还剩下什么?让我。
01:38 2
睡不着觉的一个问题就是,我们怎么知道这个模型在自我进化的时候它没有跑偏。
01:46 1
同时贝斌也在这集节目里面讲到了他自己蒸馏自己的想法。这个在过去职业生涯里,曾经每天都在跟马斯克跟陈天桥讨论技术问题的研究员。我采访的时候有那么一瞬间觉得他下一刻就工作不保了。于是我问他,我们假设真的把被冰蒸馏了,你会担心自己失业吗?
02:11 2
说不担心肯定是假的,但是即使我担心,我其实还是乐观的。
02:16 1
这一集我们就站在 AI 自进化的分界点上,与两位一线的研究员聊一聊硅谷模型的核心发展趋势,以及未来模型能不能超越人类顶尖科学家的水平,真正的去提出问题,去发现问题。下面就请收听我们今天的节目。今天跟我在一起的两位嘉宾,一位是 Simon 杜少磊。嗨 Simon 你好你好。对,Simon 是华盛顿大学计算机系的副教授,同时也是 apple dex 的首席科学家,负责训练与推理方向。还有一位嘉宾是 apple dex 的首席科学家,负责代码与自进化方向的李贝斌。
02:58 1
Hello, 贝贝,你好你好,欢迎两位。我们刚刚提到了今年有一个词儿很火,就是 RSI。然后我发现其实这个大模型它的预训练、后训练,包括它的核心的训练方向,它可能是每年都有一些新的方向出来。我记得前几年我们在聊的最火的是 deep research,深度研究在导 coding 就代码方向。今年就到了自净化 self involve 的方向。首先想请贝宾跟 Simon 大家一起来分析一下,这后面其实是几个不同的方向。还是说它有一个核心的主线在主导这个模型往哪个方向走的。
03:35 2
我感觉从训练的角度来看,其实是同一个能力在提高。其实都是推理的能力,长链推理的能力。还有就是在环境中进行一些探索,执行一些动作,获得了这个信号之后,再进行下一步的探索。不管是在 deep research 还是 coding 这些环境下,其实它的内核都是一样的,只是它的方向有一些细微的区别。我们说的自我进化这个概念,其实并不是一个新的概念了。我就不说远的在八九十年代关于 AI 和 machine learning 的自我进化,我就光说 language model 的自我进化。
04:12 2
其实往前推的话,也可以推到大概三年前左右。那个时候 google 就有一篇论文叫做 LM as a optimized。就是说用语言学习模型当做一个优化器,可以优化不同的东西。当时我在 auto 卷那边也有我的同事有出一个类似的概念,叫做 agent optimized。就是说智能助手可以自己的净化自己的优化自己。只不过这两年的话,大家发现摩西的能力越来越强了,它可以自我优化的东西越来越多了。
04:43 2
就比如说 anthropic 有八成的代码是可以自己写的。训练模型不管是从哪个角度来说,从合成数据的生成,自然语言数据的清理,还是自我训练学习的代码算法,以及 infer 底层代码,其实它都是一种代码的形式。一旦模型的写代码的能力变强了,用它来进行自我提升自己训练自己,其实是非常自然的一件事情。所以我并不觉得突然。今年大家发现我们要自我学习,自我进化,让模型自己训练自己。其实早在两三年前,大家已经开始慢慢的做这件事情了。
05:19 1
被逼你之前的背景是一直在关注模型的自我进化这条线,是吗?你要不要简单介绍。
05:25 2
一下自己的背景?对我最开始是在微软研究院那边做多智能体的合作。当然那个时候我们不叫做自我进化。因为那个时候智能体都是一个比较新的概念,所以大家一般对外说都是说智能体。但是实际上我同事的一些工作就已经开始进行一些自我进化的。
05:43 2
当时我们叫做 agent optimized 和 teacher agent 智能体。可以教智能体下一次在做类似的事情的时候,可以用哪些技能和现在的我们说的 skills 这个概念有点像。但那个时候大家用的概念还是说,比如说 context management 或者是 engineering 就是上下文管理,以及 prom engineering 就是工程学。怎么样修改这个 prompt?
06:06 2
后来我去了 meta 和 XAI,在 XAI 的时候我们就已经开始关注智能体 r endo r 就是通过强化学习来加强智能体的一些能力。比如说用工具的能力,写代码的能力,当时还有一个概念叫做 MCP toss,当然现在也非常火用 MCP 工具的这些能力。所以我们其实在早期,Simon 和我大概一年前左右就发现了,其实模型提高自己是非常可行的一件事情。包括我们当时做的一些强化学习的数据生成,其实有很大一部分是代码写的。到今年年初的时候,Andrew capacity 发表了关于 auto research,就自己进行科研的一个项目,突然一下这个概念就爆火了。
06:48 1
对我觉得非常好的自我进化的总结。今年说到模型的自我进化,跟往年来说模型的自我进化有什么不一样的地方吗?我觉得今年大家再提到 RSI 的时候,他说的是一种递归自我提升。贝比你要不要跟大家解释一下这个概念,以及就比如说我们说这个概念的时候,是不是说以前我们在让 AI 进化的时候,考官还是人,现在考官逐渐变成 AI 了,他是不是在解决更难的问题?
07:16 2
对的,这是一个非常好的问题。其实自我进化如果大家想象成是一个圆环的话,比如说模型自己找问题,自己出题,自己解答,然后自己训练自己。那 SI 里面的这个 R 就代表是 recursive 递归式,就有点像垂直的递归式慢慢向上增长。这一点确实是跟以往的一些资金化有一点点不一样。
07:40 2
当然这一个 idea 也不是新的。今年跟往年的最大的区别就是在于模型的能力变强了。比如说 anthropic 发表的论文或者是说发表的 blog,有提到 80%的代码是他们写的。然后他们可以做人类大概一天左右时间做的事情。这个能力上来了之后,因为它是可以完成非常长城的任务。所以在一个长程的任务里面,这个模型可以提高自己好几遍。
08:07 2
不像过往的,比如说我们说 LM 也是 optimized 或者是 asian optimize 的时候,这个 LM 只会一次可能优化自己大概两三个小时。因为你优化太久了,他可能因为自己的 bias 或者自己的能力不足,就很难继续往下迭代。因为他可能会犯一个小错误,然后那个小错误会自我积累,越积累越大,到之后就没有办法进行自我的迭代。而今年为什么这个 recursive 这个 R 出来了?因为大家发现这个模型可以进行很长程的任务,所以它可以让这个模型自己 recent 多提高几遍。
08:39 1
对我看这篇文章里面有一个数据,就是说 2024 年 3 月份,cloud 3 的 ops 它可以完成人类约四分钟完成的任务。一年后就是 3.7 sn t 就可以处理需要 1.5 小时处理的任务。又过了一年,这个 cloud 4.6 ops 可以处理长达 12 个小时的任务。整个我们看到大模型的改进速度是在翻倍的。而且这个比我们计算机领域的经典的摩尔定律,它的翻倍的速度还要快。
09:09 2
对,是的。当然这个业界各家都有不同的说法,但是好像大家比较接受的判断是这个模型能做到的事情,对于人类时间来说,每七个月会翻一倍。
09:20 1
对,然后您刚刚提到这个 RSI 它可以处理长城任务,我们理解这个长城是不是可以理解成它是一个需要很多个步骤,很多个环节来互相印证的一系列任务。假设我给一篇音频的文字稿给到模型去校正这个事实性的错误,这只算一步。但是比如说他能从开始的规划一直到最终这个博客做出来,这中间可能有十几个步骤,他能把每一个步骤都做好。长城任务是指这个意思吗?
09:50 2
对,是的,我说的长城任务是这个意思。当然不同的人对长城的定义也有一点不一样,但是大体方向大家都同意这一点,就是模型可以自己在人类不监督的情况下可以工作很长。像您刚刚说的,对于播客文件处理,就比如说这个模型可以先剪切一下这个音频,然后自己听一遍,发现哪里剪的不对,然后重新剪。这样可以循环几次,然后就可以进行到下一个点。这种任务可能平时对一个人类来说,可能要花 20 个小时或者 30 个小时可以做完。在这个时候,如果我们的模型可以在人类不监督的情况下把这个任务完成的话,那我觉得他就完成了这个长城的任务。
10:30 1
你觉得他是怎么。
10:31 2
做到的呢?这里就有非常多的技术细节,首先就是在模型的架构上,可能就要有进行一些创新。比如说传统的 self attention 其实是一个 own square,就是我们在算法里说的是一个 pollinia time 的算法。所以当我们的 tokens 比较多的时候,特别是在 100 万个上下文的时候,其实模型首先就是在推理的时候就会花非常多的 resource。这个我们有很多现成的解法,就比如说 GDNGDNV2 deep seek v4 pro,它也有自己的一套架构。
11:06 2
第二就是训练数据,我们要 100 万上下文 difference support,其实不是特别的难,我们只要把模型训练好了,放到 SG line 或者 v LLM 里面,给它参数都设置好,它可以支持 100 万上下文,甚至更多的上下文。但是如果你的模型没有在这种非常长的数据下进行训练的话,那它可能就是我们所谓的 out of distribution。因为 100 万上下文是非常长的一个概念,就大概哈利波特好几部书放在一起。而我们的代码即使是最大的 report,也很难会 set rate 来满足这 100 万的上下文。所以在预训练和后训练的数据处理上也是非常大的一个挑战。
11:47 2
第三点就是 info 也是一个难度,不仅是说在 testing time 的 info 而且是在训练的时候的 info。因为你要如果让这个语言模型就直接输出 100 万个 token 的话,我们需要就比如说在 GPU 上做一些什么样的优化,在 kernel 上改一些什么样的代码,这些也是非常困难的事情。所以这个就是为何训练这种长城任务相对于普通任务会是指数级的难度增长。
12:13 1
了解塞梦有补充的吗?还有就是真想解决长城问题的话,可能从 A 站的架构上也可以有很多可以做的。因为即使是我们有 100 万的上下文可以处理,但是真正完成的任务可能都还是不止 100 万。那这个时候我们还是需要比如说在有限的上下文里处理,甚至是无限的上下文,那怎么做呢?还是需要一些比如说 agent 技术,记忆的技术等等,去处理这种超长程任务所涉及的超长上下文这样的问题。
12:45 1
我们听起来很简单,但是这个中间可能涉及到了很多具体细分的技术体系。之前我记得贝宾你有讲过,训练一个模型其实本质就是 data 数据 infra 基础架构和算法这三件事儿。其实这三件事儿都高度的依赖写代码。所以我们今天看到像 cloud 它能表现出这么强的基础模型的研发能力,主要是因为他 coding 能力的提升,自净化的能力,它也是跟 coding 的能力是紧密相关的。
13:14 2
我可以这样理解吗?对我基本上同意。
13:18 1
这个看法。对,所以 coding 它会变成所有模型的一个标配的底座。
13:23 2
我觉得它会变成大部分模型的标配底座,但并不是所有模型的,就比如说聊天型的模型可能不太需要写代码的能力。当然了聊天型的小模型可能也是通过一个大模型进行蒸馏的。所以它后面这个大模型需要非常大的,比如说 reasoning 推理能力,需要自我进化,所以能自我进化来蒸馏到小模型里面。所以它背后的这些大模型肯定还是需要高度优化写代码的能力的。
13:52 1
我可不可以理解成单纯的聊天还好。因为现在我们其实都在讲怎么让 agent 完成一系列的事情。如果一旦说涉及到了多步骤,然后让 agent 去完成不同的复杂的任务的时候,coding 能力就会变得。
14:06 2
特别的关键了。是的,没错。因为 coding 其实写代码不仅是写代码本身,而且可以通过写代码训练自己。另外的话他在 coding 里面要进行的归纳演绎这些逻辑推理的基本的思想和算法,其实也可以帮助模型在其他的一些方向上进行优化和 generalize,就是可以泛化到其他不同的领域里。
14:29 1
我发现在学术界,其实自我进化它还有一个很根本的障碍。就我看大家起了一个学术的名词,叫做递归漂移。他的意思就是说模型在自己去生成它的训练数据的时候,它推理的错误会在一次的错误中一代一代去累积。就比如说有的时候我们看他给我们的一个答案,这个答案的结果可能是对的,但是他的推理过程可能是错的。在这种让他自我进化的过程中,他就会把这个错误一代一代累积,最后可能进化的结果就越来越歪。这是两位在真正的训练模型中遇到的一个比较根本性的难题吗?
15:10 2
我非常同意这个看法。这个现象其实也是我们大家一直有注意到的。Apple dex 有一个不一样的地方,就是我们比较注重 verification,就是自我验证。就是模型自己在训练自己的时候,如果它的验证有任何的漂移或者是 bias 的话,会对结果造成不好的影响。因为它可以累积起来。所以我们在做比如说写代码和做数学计算的这些任务的时候,我们比较容易验证。可以通过 rule base,就是可以通过跑一套测试代码来确定它有没有对。所以在代码领域相对来说更好解决这个 recursive gift 的问题。
15:50 2
当然了,如果对代码领域有了解的一些专家可能还会发现,即使是有 test script,即使有这个 test code,它其实偶尔还是会发生漂移。就比如说 test case,不管是人还是 AI 在写测试代码的时候,可能偶尔会太窄。太宽的时候可能会让错误的解题代码通过,但如果太紧的话,有时候会惩罚写的对的代码。所以这种情况下也是还会发生细微的递归漂移。
16:20 1
但是它会简单很多。对我其实很好奇,你们怎么去做验证。因为我知道 apple dex 验证其实是你们主打的一个核心功能。因为我去试用了一下你们的产品之后,我是有收到一封邮件。这个邮件的标题非常有意思,它叫做很多 AI 系统生成答案,而 apple dex 验证他们后来我才知道,原来你们公司的名字 apple dex 它是源自于一个希腊语,它的意思就是证明跟论证。所以相当于你们从成立的开始就把验证较真儿写到了名字里面。
16:54 1
对验证这一步我们有很多套方法,因为不同的领域确实需要不同的验证方法。比如说代码,一般来说你可以用单元测试进行验证。当然你怎么写,有时候会过宽又过窄,这是另一个很难的问题了。数学可以通过证明,然后证明现在有另这样的 formal 验证的方法去验证。
17:17 1
但不得不说还是有很多的问题,其实是更多依赖于人的一种判断,甚至都并不是一种百分之百正确或不正确。这种时候我们其实是依赖一个 agent 系统去做我们现在 apple dex 1.0 的验证的,我们管这个叫 agent team。大概就是说把一个问题最开始会分解,然后我们会有不同的子 agent。有的是去解决这个问题,然后我们会有另一个子 agent,单独的去验证另一个子 agent 写出来的解法。之所以要分成两个子 agent,还是因为上下文的问题,不要让一个 agent 干所有事情,分成两个 agent 其实效果会好很多,这是一个细节。对,而且一定要拆成两个 agent,同时两个 agent 给他的指示也不太一样。
18:06 1
除此之外,还有一些比较重要的技巧。我们最好是有一些冗余,同一个问题你让不止一个 A 镇的去做,然后我们会得到不止一份答案。其实这个冗余的思想在计算机里面有很长的历史了。但我知道不止一个答案之后,我们会让一个全局 agent 去判断一下哪个 agent 的反馈的答案更准确一些。这样会比只用一个 agent 去解一个方面的任务会效果好很多。
18:34 1
这是从 agent 方面,我们有这些设计去做一些验证。在训练的时候我们也会专门针对验证去训练一些了。比如说我们会让 agent 去判断一下不同信息源搜集的信息,哪些是更靠谱一些,哪些不靠谱一些。比如说一个论坛上的可能就不如教材上得到关于同样的问题靠谱了。那贝彬有补充吗?
18:57 2
另外的话,我们在进行强化学习的时候,我们的裁判也会在训练的过程中一起学习。这样的话可以避免模型学会一些不好的行为,可以避免他进行一些奖励黑客。
19:11 1
因为现在我们说市场上的很多公司,他们可能都在做 RSI,然后也都在做验证。那大家觉得在这么多的模型公司里面,该怎么去判断一个公司这块儿的能力是不是真的强?它是一个技术问题,还是一个比如说我把更多的精力跟时间投入到这儿,它是一个意愿的问题呢?
19:34 2
我觉得两个问题都是,首先技术问题肯定是需要有的。因为在自我递归和自我进化的时候,如果它底层的代码 info 或者是训练代码有问题,技术不达标的话,这个是肯定做不成的。另外意愿也是很重要,有一些公司可能还没有意识到自我进化的一些需要强化的点在哪里。
19:57 1
真要判断一个公司的技术能力,可能还是需要去了解一些细节。自我进化这方面其实有很多种,比如说我就在 harness 这个脚手架上进行进化,然后有的是在预训练的各种配方上进行进化,有的是在后训练包括搜集数据以及后训练的一些配方进行进化。如果真的想判断一个公司技术水平,我觉得还是要先聊一下,看看他们到底是在哪方面。据我们了解,说实话在脚手架上进行进化是护城河比较低的一个原因。确实它的成本比较低。因为你基本只用调 API,你就可以自我进化这些 harness,这些脚手架了。所以这方面即使开源社区,包括学术界也有很多的结果。据我了解,学术界包括开源社区做的也都不错。当然公司里可能会有更多的资源,但其实这些技巧上可能细节上,即使用那么多资源,你可以做的很好。但如果真的要涉及雨后训练这样自我变化比较难的一些方向,确实你需要很多的资源。
21:03 1
跟这些公司聊的时候,可以知道他们比如说是通过什么样的方式去进行后训练一些进化,然后预训练这方面,现在可能大家看到的都是一些 auto research。比如说什么自动去训练 nano GPT,这些确实都是一些比较玩具型的一些任务。因为他们的这个模型都比较小,然后你可能调一个更好的优化器,更好的超参数等等。这些也是最近的资金化的一些 paper。但真正把这个能不能 scale 到产品级或者真是大模型,其实是需要特别了解的。
21:35 1
如果他们光说我是在一个公开的一些 auto research 一个 benchmark 上,我怎么样,其实这个并不是代表什么。那我讲的特别好,你们现在是怎么做的?或者说你们一个理想式的目标未来会怎么做?然后现阶段是有哪些路径可以去达成?
21:54 2
我们其实在自我进化的时候,把它分成了不同的阶段。我们有训练和后训练阶段。预训练阶段的话就是在数据的采集清理上面会进行不同的自我进化的一些方法。在后训练里面自我进化可能更加有效一点。因为我们在一个模型出来了,经过了后训练之后,我们才知道他会有一些什么样的问题。所以我们的后训练自我进化就包括诊断自己有什么症状,哪里不达标,然后基于自己的诊断来造不同的训练的配方。第三步,拿到自己训练的数据和配方来自己训练自己,在其中需要 verify,就是验证自己每一步做的是否正确,最后回到第一步,再诊断自己有什么缺陷。另外在脚手架 harness 上面,我们也有一些自净化。同时在脚手架和后训练,因为它其实挺难解耦的,所以模型在后训练上进化之后,我们的脚手架也会进行一个新的进化。你可以把它想象成两只不同的脚,左脚会踩一下,然后右脚会踩一下,让这个模型往前跑。
23:04 1
我理解刚刚根据贝宾你说的,就是你们所有的三种方式预训练、后训练,包括整个 harness 的环境全部会用到。
23:12 2
对的,因为我们公司其实就是把自我进化当做是主要的方法论,所以我们在每一个方面基本上都会用到自我进化的思想。
23:21 1
难怪你们可以把验证就写到你们的整个的 slogan 里面。对的,这个我稍微补充一下。一个是验证能力是非常重要的。然后验证能力的其实一个是像代码这些,你可以去 formally 去这种验证。还有很多的时候是模型本身的,我们管它叫原能力或者 meta 能力。包括判断这个答案对不对,分析现在模型的问题,根据模型的一些 output。所以这些是一些这种圆的能力,这个我是需要特别的去训练的。
23:56 1
还有一点我想强调一下是搜索能力,尤其对于后训练是非常重要的。因为后训练绝大部分的方法,就是说你发现你的模型有什么缺点。假如说你的模型已经可以判断出来当前这个模型有什么缺点,那么你需要去针对性的造一些任务以及对应的答案,还去提高模型这个能力,这个噪任务其实非常依赖于搜索能力。基本上你造任务还是需要去网上搜索对应的一些,不管是语料,还是代码,或者相关的资料,然后造出对应的题目。所以 search 搜索本身是一个非常重要能力。这个也是我们为什么最开始先去做 deep research。
24:35 1
因为 deep research 是一个非常 general 的能力。其中搜索可能是一个非常本质的能力。因为它就代表了当你模型需要提高哪个能力的时候,它可以指引你或找到对应的这些数据去提对应的能力。
24:48 1
对对对,然后你刚刚提到了 deep research,现在应该是你们现在 apple dex 放出来的这个版本中目前最强的一块儿,对不对?但这应该只是第一步。是的,就像我最开始说的,自建化你最开始有一个先做 deep research,然后相当于你可以收集目前已有的信息,以及当前模型的能力。你可以制定一个计划,然后你去写 code,去提高自己的模型,然后你得到一些反馈,再做 deep research 就可以这样 resistance ly 的提高。所以 deep research 是一个比较重要的一环。
25:22 1
对,然后我了解到 apple dex 你们的这个模型是在通义千问的基础上做后训练做出来的。Simon 你要不要跟大家讲一下 deep research 它的训练范式,它有发生一些什么样的变化?比如说通过预训练做出来的 deep research 跟通过后训练做出来的 deep research 它有什么不一样?为什么你现在会先选择后者?因为我们公司也是刚建立,所以我们先开始从一个开源的模型,就是千问 3.5 上进行后训练。得到目前的一个模型后,训练上我们会有一些原子能力特别的提高。比如说模型最开始做计划,我们会生成特别多的对应的数据,去专门提高模型这样能力。
26:06 1
然后另一个能力就是搜索能力,搜索能力也是我们造了很多对应的题目,针对性的去提高模型的这些能力。还有就是说跟 agent team 结合,我们去造了一些题目。这是就像贝宾说的左脚踩右脚这样一种感觉。我们需要 agent team 和数据一起开发,然后达到最后的效果,这是我们主要后训练做的事情。当然有了预训练之后,我们这个模型会越来越强。然后预训练我们也是正在开发之中,之后也会从预训练的角度去做 deep research,包括去训模型。是的,我们公司最后会有一个完整的链路,就是从预训练开始到最后成品到产品都会有的。
26:51 1
OK 我注意到你们现在是在好几个 deep research 的榜单上都拿了第一名,对吧?是的,要不要讲一下?对,这些包括 scup,这是 open eye 的一个 benchmark。然后还有 deep surge QA 仿 tier science 这些都是这些仿 tier lab 出的 benchmark。
27:11 1
Gross com 其实他更关注的就是搜索能力,它就搜索特别刁钻的一些问题。比如说我要搜索一本书,它是几年之前出的,它的首字母是什么 ZY,大概这样的一些问题。这方面我们是 sota 对,sota 就是最高水准的意思,就是比包括闭源模型都要好一些。
27:32 1
Frontier science 更多的是给你一个实际中的科研问题。你能不能制定一个计划,然后一步一步的该怎么做,大概是这样一类的问题。他会用一个 LMSA judge 去判断一下你这个合理不合理。当然它的原来的 benchmark 里有很多具体的判别标准,去看你生成的合理不合理。这两方面我们都是说深入研究,而且造出了对应的题目。去提高我们模型的能力。然后还有一方面就是我们之前讨论过的 agent team 整个的范式,包括 version ation 这个验证,还有最后有一些冗余。然后如果通过更多的冗余去判断,得到一个更全局的结果,去做生成一个答案,这整个的系统是让我们拿到了 sota 的水平。
28:20 1
然后我看见像这种一般是能上网的模型,它有的时候它那个答案不是 AI 推理出来的。可能是因为他是搜索到了,然后他就会有一些失真。所以我注意到你们自己在做评测的时候,还是专门把这种能搜到答案的网站给屏蔽了,是吧?自己去做的。是的,这个还是一个现在游戏搜索类问题的一个 general 的问题。
28:44 1
因为这个 benching mark 只要它公开了,那么它的答案就是大家也知道,你可能直接在 github 上新生成一个页面,上面把答案放上面,那我新的一个模型直接就可以搜到这个答案,那我就算做对了。但这样并不是真正奔驰 mark 目的这个问题的目的还是比如说去考验你一个叫深度搜索的这样的一个能力。所以我们一般还是会看一下我们自己生成的答案是不是进行了一些作弊的行为。如果有这种作弊行为,我们会把比如说 github 屏蔽掉。但有些榜单其实已经污染的比较厉害了,干脆后来也就不报了。
29:19 1
然后我注意到你们在这个 deep research 的后训练环节,其实你们相当于是用一个整个的 agent 的团队去替代单个 agent 的验证的。你一个比如说复杂的任务,你能调动上百个子的 agent,你会认为是一个聪明的 AI,反而干不过一个会相互 check 的团队。对我非常相信这一点,因为这是目前我认为是基于 self attention 结构的一个本质问题。而且我认为即使你用 linear attention 这样一些新的结构,我应该也解决不了超长上下文这样的问题。看越长 attention 的注意力,它这个效果就越差。所以你单个模型至少在目前的技术范式下,它还是有上限的。当然这个跟人类也很像,就是说人的脑子它还是有限的,所以你才需要纸笔把一些信息记录下来,然后之后你再调用它。
30:13 1
至少在近期,我其实不太相信有一个 agent 能解决特别长的上下文的问题。所以这种时候你就需要多个 agent 以及记忆力机制。比如多个 agent 去解决不同的问题。包括记忆机制把这些信息保存起来,互相分享,整个的一个系统去解决一些超长程的问题。
30:33 1
所以你觉得现在我们说到 deep research 它的能力的话,它的工程能力跟模型能力谁更重要呢?我认为这两个属于一加一大于二的一个结果。你当然可以一直去强化模型能力,而且模型能力我认为现在还是可以继续提高的。
30:53 1
但是当模型能力达到一定程度的时候,你稍微做一些 agent 上面的优化,你可能就一下子大提高这个能力。当然你 agent 这工程它总是有限的,或者说 agent harness 脚手架上的提高总是有限的。然后这个时候你还是需要一些模型能力的本质提高,进一步提高 deep research 或 generally 整个这个系统的能力。所以我认为这两个基本上是一个一加一大于二的一个感觉。
31:18 1
对我虽然知道你们主要是在做模型的,但是想替创业者问一个问题。我们说之前大家在创业的时候最担心的一个问题就是说你的模型的基础能力一升级。基本上所有这些干 agent 的,干垂直方向领域的,他的能力很快就会被这个模型的基础能力给覆盖掉。如果按照我们刚刚讲的一个聪明的 AI,由于 attention 的 transformer 的整个架构上的一些限制,他反而干不过一个相互 check 的能力。是不是说现在一个能把工程能力做到极致,把很多个子 agent 他用的非常好的团队,他也具备自己一个非常深的护城河,不太容易被模型智力提升给覆盖掉。我基本上是同意这一点的。
32:03 1
Agent 的系统本身我们也是经过大量实验才验证出来,我们这个目前的系统是比较合理,而且是效果很好的。如果一个创业团队真的是证明了自己在用整个 A 镇的系统达到了一个非常好的效果。那肯定他们之前也是做了大量的实验去验证,这个确实是非常 work 的。但是,怎么说,这个领域相对也比较卷,能做这种实验的团队可能也不少。因为这个并不是说训练一个模型,确实还是需要很多资源。但是去调或者做 agent 的相关的实验,还是相对来说需要的资源少一些。你基本上只要调 API 就可以了。当然有些垂直领域其实你可以越做越深了,包括金融、法律,确实还有些具体领域的知识经验,其实还是挺有意义的对贝彬有补充的吗?
32:53 2
往后退一步想的话,如果一个模型或者说一个 single agent 单智能体能做的很好,那如果我们把它 harness 设计的更好的话,来多个智能体一起合作,那可以把这个问题做得更深更好。所以我觉得在垂直领域做这种 agent teams 或者是做脚手架的公司,未来肯定还是有发展的,而且是有非常多的机会的。就是有一点要注意,因为现在模型的发布非常的快,可能每个月都会有一两个比较强大的模型出来。所以有了新的模型,可能这个脚手架的设计也要微调一下。因为新的模型会有新的一些能力,有自己的一些品味模型,自己的一些行为都会不太一样。所以这个脚手架调一调,可能会做的比以前还要好。这个也是我们在之前做自我进化的时候发现的。
33:42 2
为什么在后训练以及在做这个脚手架的时候很难解偶?如果你的模型能力或者是说训练数据稍微变一下的话,那它对新的脚手架的适应能力可能也会有一些微微的改变。你可能可以设计出更好的一加一大于二的效果,或者是说模型变强了的脚手架变得也很强,然后放在一起可以打出一个爆炸性的效果。
34:05 1
听起来现在还是一个行业很卷很辛苦,要时刻跟着模型迭代去更新自己架构的这样的一个行业。
34:12 2
对的,我同意 AI 行业一周可能相当于传统行业一个月甚至一个季度。
34:18 1
那接下来就可能是聊到我最兴奋的一个板块了,就是 apple dex 它是要做 discovery model 的。Simon 你要不要跟大家先介绍一下整个 apple dex 它是一个什么样的模型?它其实是大家很关注的陈天桥先生创建的。他是说自己要去做一个让 AI 做发现,做科学这样的一个模型。
34:41 1
对我们的长期愿景是 heavy duty server。然后我们强调的是解决很难的问题,而不是比如说一个聊天机器人这样的大模型初期的一些应用。然后我们的手段是通过自我进化,这是我们一直在强调的。我们相信大模型最终是能解决人类之前解决不了的这些问题。
35:04 1
从经济的角度来说,现在大部分的模型厂商都是在卖 token,对吧?但我们相信真正通过大模型去解决了一些人类没有解决的问题。那么解决问题本身所创造的价值应该是远大于 my token 的这个价值。所以我们陈天桥陈总这边的目标就是说我们直接去解决最难的问题。从经济上来说,我们可以得到直接解决最终问题的这个价值。从问题角度来说,我现在考虑的领域包括生物,材料科学等等。然后我们这边也有一个专门的团队,我们叫 heavy duty discovery,就是专门去找到最难的问题的一个团队。然后我们会针对性的,比如说进行模型训练等等,去解决那些最难的问题。
35:51 1
比如说你刚刚提到的,你们内部有一个 heavy duty discovery 的团队,他们现在具体是在找哪些问题?就现在你们第一步想要切的是生医药领域,对吗?是的,第一步是生物医药,包括制药靶点发现,老药新用,也包括疾病诊断,很多问题确实是非常具体领域的问题。所以我们需要一个专门的团队去找到什么样的问题是合适去解决的。
36:18 1
很期待你们的下一步,我觉得我们可以说一下让这个模型解决问题。然后我发现其实你们也给自己的定位说,你们要做的是 discovery model 而不是 generative model。中文说就是你们要做的是发现的模型,而不是生成模型。贝宾你要不要跟大家解释一下这两个模型它在根本上的区别是什么?对。
36:40 2
让模型提出一个假设其实并不是特别难的,但是难的就是提出了这个假设,特别的 out of distribution,就是可能在 pretending data 在网上比较难找到,或者说比较难想到的一个假设,这是第一个。第二个更大的难点是说我们要怎么样验证这个假。当然这个跟怎么样做 verification,怎么样自我验证也是强相关的一个部分。所以如果我们把 discovery 切细来看的话,第一需要非常的有创新性能,提出新的假设。第二需要能判断这个假设成不成立。当然这里也有很多不同的方法可以做,就比如说可以用 deep research 的方法收集已有的信息,找更好的假设。也有可以用写代码或者是 self verification 的这些方法来跑一些实验。如果我们能在计算机上跑一些,比如说模拟的话,也可以让我们对这个提出的新假设更加的有信心。所以 discovery 的瓶颈第一就是未知领域,其实很难有标准答案,也很难照这种 simulation environment 得到可信的验证。所以 self evolution 是我们通向 KV duty 的和 discovery 的一个主要方法。
37:52 1
对我们在说到 discovery model 的时候,刚刚你提到了我们要做很多假设,然后要去求证。其实这让我想到了科学领域最基础的一个方法,就是八个字儿,大胆假设,小心求证。我觉得这其实也是我自己开始做记者做报道的时候一直在贯彻的一个价值观。就是要大胆假设,提出傻的问题,然后再去求证思路跟这个问题是不是对的。但是同时如果我们把这个交给模型的话,大家以前一直对这个模型的印象就是说一个模型它能从网上,从人类现有的知识库里面找到已知知识的答案就已经很不错了。现在模型的智力怎么样才能够让他做到理解贯穿人类的知识,同时还能提出问题。因为我觉得这个已经不是说在让 AI 去做一个解题者了,这个更像是让 AI 去做一个科学家,他能够提出问题,发现问题,这个是很难的。
38:49 2
对你刚刚提到的这些其实是现在的一个难点。因为怎么样训练一个 generation model,其实市面上已经有非常多的可行性方法,相关 recipe 和训练配方其实也是特别成熟的。但是如何让这个模型进行一些假设和 discovery,这个其实是大家还在调,没有完全调通的一件事情。
39:12 2
回到刚刚你说的一点,怎么样像科学家一样在未知中提出问题?这里也可以再往下切细一点。比如说在写代码这个领域,比如说 swe verify 的这种类型的题目,其实我们都是在训练模型怎么样做一个解题家。但是会提问其实是一个我们叫做的 meta 能力,更高维的一个能力。这个其实也涉及到了我刚刚说后训练的一个 loop,就是要自我诊断,然后再自我造体,然后再自我训练。你要怎么样在这个模型现在的回答里面,或者是所有的收集的这些信息里面,怎么样诊断出哪里的能力有问题,或者是哪里的 hypotheses 需要往深入更看一下的话,这个是我们接下来会注重的一个领域和方向。
39:58 1
在学术界大家都知道有好的 paper 跟灌水 paper 其实我们也想培养模型,变成了一个真正的好的科学家。那么你就需要培养一个非常好的 taste,就是学术品味。你提出一个新的问题,肯定是需要先做 deep research,找到已有的知识。但你提出什么样的问题,其实是仁者见仁,智者见智的。你可以提出一个比较我们叫 incremental 的问题,它可能比较容易,但是你可以发一个 paper。但你也可以提一个比较本质的 fundamental 的问题,它可能不是那么解决,但解决了他真的是能让科学有所突破。所以这个也是我们之后会进一步训练模型,就是说让他有更好的学术品味。其实训练方法上可能还是需要跟人类最顶级的科学家去对齐。这些陈天桥陈总这边其实也是经常会让我们和一些顶级的科学家一起去讨论,甚至他们提供一些 insight 或者数据等等,去帮助了模型有更好的品味。
41:01 1
我觉得其实两位也是顶级的科学家,顶级的科学家大家觉得他们有什么样的共性?比如说我们从他们身上学到的特质,怎么把它转换成一种计算的方法,或者说是跟 AI 交互的方法。这块大家有什么样的思考吗?我们一般说什么样的是一个顶级科学家,一般不是看他有多少篇 paper,一般是看他最好的 paper 质量有多高。所以我们一定要追求顶点了,解答这些最本质的问题。所以这个甚至要写在模型宪法里。
41:38 1
然后具体实操上,训练方法上可能还是目前已有的一些。比如说 RHF 这种人类偏好 SFT 监督学习,或者 RL 这里可能一个最简单的方法当然就是偏好了。比如说你问一个科学家两道题,它一般是能判断出来哪个是一个灌水题,哪个不是一个灌水题。然后你应该让模型去多提一提非灌水题。AI 现在能判断哪个是灌水题,哪个是非灌水题吗?只要经过这方面的训练,我觉得还是没什么问题的。贝彬你觉得在跟一些顶级科学家交互的过程中。你有学到什么,以及你觉得这些思想怎么可以用到模型。
42:17 2
的训练中去。对我想来想去可能还是品味这个字。其实 AI 马上就能进行自我进化了,我对这一点非常的坚信不疑。要么是接下来半年,要么是一年,反正在接下来两三年内肯定自我进化就会成功了。那在那个时候我们还需要顶级的 AI 科学家干嘛呢?或者是说我们还需要人类干嘛呢?
42:39 2
然后想来想去就是品味这个字。因为训练这些不同的模型的时候,我发现了这个品味是真的。同样读完一篇 paper 之后,你可以想到一个非常小的改进,或者你可以想到一个 substantial improvement。就是一个非常长的非常大一个假设。但是要干非常多的活,要唛非常大的步子才能解决的问题,这是一个非常好的例子。
43:04 2
其实我现在觉得即使是市面上最好的模型,它的品味其实也是远低于一个普通的 AI 科学家的这也是为什么现在 AI 写代码写得很好,但是还是不能把模型的训练全部自动化进行起来。所以我觉得接下来不管是作为一个人类 AI 顶尖的科学家,还是说作为一个 researcher,一个 engineer 在训练这个模型,都是需要把控模型的品味的。这个其实是非常难的一件事情。因为如果大家用过很多不同种类的模型,大家会发现所有模型其实有一些通病。就是他们或多或少都挺喜欢拍马屁的。一个喜欢拍马屁的模型其实很难提出一个大胆的假设。
43:50 2
另外除了拍马屁这个缺点之外,它其实还是有一点我们叫做 hydron behavior,或者是一些对冲的行为。就是说这也对,那对用户你说的非常对,刚刚是我的疏忽,但是我说的也没有错,你说的更全面,你想要问其他的问题吗?我们可以看到这些 AI 模型经常会用这样的方法来回答用户问题。所以我们在训练不管是说 verify 还是 self evolve,还是 discovery 的时候,都会对模型的提出假设的能力进行一个后训练。就比如说这个 diagnose 里面。
44:23 2
但是这也是有另外一个缺点,就是我们怎么样能保证我们训练的新的模型不会出现鸡蛋里挑骨头的那种行为呢?这就是要品味来平衡,就是模型不要拍马屁,也不要鸡蛋里挑骨头,能真的是实打实的提出一个非常好的假设,然后再像您说的,就是小心验证,把它验证出来。这个假设你。
44:46 1
刚刚提到了模型拍马屁,就是用户说什么他什么就是对的。我确实发现我在用很多模型的过程中,这是我觉得最痛苦的一部分。就是他不会给你一个事实性的答案,他给你的永远是迎合你的那个答案。这块儿是不是跟在训练模型的时候,把这个模型的参数往哪边调,然后给它注入什么样的人格特质是有一定关系的。而且每一家模型,其实我觉得大家的风格细微上都会有一些不一样。
45:14 2
当然我们 apple dex 因为不做聊天模型,所以可能会稍微好一点。就是因为我们不管是哪家公司,在后训练的时候,或多或少都会有一个 ROHF 的一个阶段。这个 ROHF 它的来源数据基本上是用户投票的数据,就有点类似于 OMC arena 这种形式。也有可能是模型训练公司自己让员工去标的一个 preference 偏好数据。
45:38 2
人不是完美的,所以人类作为本身就会可能有特殊的偏好。比如说偏好说好话、拍马屁的模型答案,可能偏好写的非常长的答案,可能偏好格式上非常的结构化。像有非常多 section,非常多 list 的一个 markdown 的格式,即使这个 markdown 它本身没有什么实际的意义,就是因为这种人为的一些 bias,才会让这个模型有不同的拍马屁的行为。Apple dex 因为想做 heavy duty 的 server,所以我们不会用网上大众的这些人类的偏好来训练这个模型。所以可以或多或少的避免些许这样的问题。未来我们在训练这个模型的时候,肯定是想要最顶尖的人类来标这些 preference 数据,或者是说给不同的模型答案打分,确保公正公平。也可以从数据源头稍微解决这些问题。
46:30 1
我觉得这几个方向都还挺重要的。然后你刚刚提到了既不要拍马屁的模型,也不要鸡蛋里面挑骨头的模型,可能不做拍马屁。因为你们不做 to c 的用户端,这个对你们来说是稍微简单一点的。不做鸡蛋里面挑骨头这一块儿,你会有经验吗?以及我们知道了两个不那要做什么样的模型,要把什么样的人格注入到这个模型里面,大家有什么样的想法吗?
46:57 2
对的,刚刚我们其实是聊的品味,我把左和右两个布打出来,中间我们要的就是要有品位的。不管是这个模型通过 research 找到了一些相关的信息,还是通过写代码得到了一些答案。有了这些所有的原始材料之后,这个模型要通过自己的思考,自己的推理来给出一个相对比较合理的解释。Agent team 的话其实也能稍微把这个问题解决一点。
47:26 1
对拍马屁这个事情我们其实是在做的,就是说用户让我们做的事情。但如果我们觉得不合理,那么我们应该告诉用户,我们不应该去拍马屁。我们其实是有一整个系统去达到这样的目的的,包括我们的 constitution AI 就是说我们这个宪法这个概念应该是 ano pic 几年前就提出来了。然后这个给我们整个模型定义了一个性格,我们都是把这种性格训练在模型的权重里了去实现它。当然还有很多,比如说我们注重真实性,比如说如果用户说错了,我们要去纠正它。那这样的里面的细节就是通过验证 verra ation 或者 agent team 整个的形式,或多或少会去验证用户说的对还是不对,然后我们会去反驳他。至于什么样的问题是好问题,就是不在鸡蛋里挑骨头,这个确实是一个品味问题。这可能你甚至让我们去写一个宪法或者写一个 dog,告诉你什么是好问题,什么是不好问题,也是很难写出来的。
48:26 1
这方面更多的还是通过和顶级科学家去聊,以及顶级学家提供的一些比如说偏好数据等等,去培养这样的品类。其实这个也是和平时我们在学校培养 PHD 是一样的。比如他们来问我们是什么样的一个题目,值得做什么,不值得做。我们也会告诉他,确实我们公司有这种能接触到各行各业的顶级科学家的资源,这是非常重要的一点。所以这也是陈天桥陈总从一开始的一个 vision。就是说我们从一开始就要做 happy to server,所以我们就需要和顶级科学家进行对齐,然后去培养这样的品味。这点提的特别好啊。我确实知道陈天桥先生这边跟很多主流顶级科学家都保持着非常密切的联系。
49:11 1
然后我在想,因为人类的顶级科学家这个数据量的样本是非常小的。然后我们说大模型它大很重要,就有 skin law 顶级科学家人工去判断的品味标注的数据跟用更大量的数据去训模型来比,在里面它能贡献的核心的比例是多少呢?因为它的数据样本还是很小。是的,从数据这个角度来说,预训练方面确实需要大量的数据,所以才有 scadding law 后训练相对来说需求会少一些。而且现在已经有更多的方法去把一个人类的品格或者性质总结出来。比如说 meta 最近也是在蒸馏员工等等,其实也在蒸馏三号他们的性格或行为习惯对吧?所以其实最近越来越多的还是说把一个人类类的一些品格性格去总结出来,还是慢慢的可以做到的这也是一个比较新的方向。就是说一个个体他的能力性格等等,能不能用一些自然语言或者说的一些方式把它转化到,让大模型可以去利用起来。
50:18 1
对,我记得在音乐模型刚刚兴起的时候,就是苏诺的那一波。当时就是我有问做这个音乐模型的科学家,我说苏诺做的歌太一般了,我觉得他就是一个大街上的口水歌。然后我说他能做出像周杰伦、Taylor swift 这些非常好的有很好品味的歌曲吗?他当时给我的答案是,他说可以。但是这个事情他不是受限于技术,它是受限于版权。因为版权的因素,他们不敢拿顶级音乐人的歌曲去训练。对,他们用的就都是那种版权库里面一些简单配乐的歌。但是如果你真的用这些人类最精华最好好的歌曲去训的话,他觉得是完全可以训出来的。
51:03 1
如果我们说用顶级科学家的品味去去模型,是不是也是同样的道理?对的,我很同意这一点。我们人类也是从比如说一个婴儿开始,最后有的就成为了顶级科学家。尤其从一个顶级科学家这条路,其实也是别人给他的这些反馈,告诉他什么是好的,什么是不好的,而且得到的数据也并没有那么多。我们还是相信通过顶级科学家给我们的这些指导,我们可以拥有顶级科学家的品味。
51:33 1
对,然后我注意到其实想让 AI 去做科学家,自己去做发现的模型,几乎也是所有的现在我们说顶级模型公司都在做的。比如说 OpenAI 它已经把能自己扛下一个大型研究课题的 AI 研究员,定成了未来几年的头号目标。Deep mind 他创立的那天起,他也是为科学而生的。我们之前讲过 deep mind 的创始人的历程,大家有兴趣的话可以回听一下我们一期的播客,阿尔法 fod 他还拿了落奖。现在包括 jm 奶,他也是说自己要去做多智能体的 co scientist,就是共同合作开发的科学家。同时 anthropic 他的 darrell,他也想要有一个国家级的科学家的天才。所以我听上去,现在所有的顶级模型公司都想去做科学家,都想让 AI 去做发现,去提出好的问题。
52:27 1
你们觉得 apple dex 它的核心优势是什么呢?我觉得不做 to c 类的模型,应该也可以算是一个核心优势。因为它可以去调一个模型的权重。还有其他的吗?这个战场是相当激烈的,你们进入了最激烈的战场,这个我很同意。但这个战场的首先价值是很大的,因为它真正解决的一种难的科学问题,它是有很大意义的。另外科学问题其实还是一个非常广的,因为这个世界上有那么多学科,其实你解决其中几个问题就已经足够说是一个很大的突破了。所以我觉得不止一家公司可以成功了。
53:03 1
Apple dex 这边的优势,我觉得就是我们比较专注。一是就像你说的,我们不是一个聊天机器人这样的模型,我们基本也不取悦用户的一些特别的偏好。其实到现在大模型的整个发展,比如说训练的各种 recipe,或者这些配方算法什么的,大家也都知道的大差不差,更多比拼的就是一种执行力,以及整个组织架构。我觉得我们这边自上到下从陈总那边开始,他自己也是一个非常卷。然后整天会和我们进行交流,整天会和 AI 进行交流,并且给我们不管从方向上还是一些其他方面都提供很多指导以及帮助。然后我们下面执行力都很强,因为我们还是一个非常小的 start up 的 culture,所以我们还是比较 focus 做好这一件事情,做一个 heavy 的 server。我觉得从这个组织形式上,我们还是和大厂大公司相比有很大优势。我们这边摩擦也比较小,然后交流成本也很低,这些或多或少都是很重要,对于一个大模型公司能快速发展的关键。贝彬有补充吗?
54:08 2
我其实做所谓的 AI for science 这个概念已经做了有十多年了。我在读博士之前就在做 AI for science,当时主要是在医疗行业和自闭症用 AI 其实刚刚你说的,现在很多公司都开始往 AI for size 做。我其实觉得并不是一个竞争,反而我觉得看到的是希望的曙光。因为过去十几年来说,科学技术或者说 IT 技术 for 科学研究,其实是没有太多真实非常 scalable 的成果的。但是因为 LM generation model 和 discovering model 的技术的提升,我觉得在未来,比如说 5 到 10 年,真的做出非常有科研价值和现实意义的成果,是有非常大的希望的。
54:52 2
这个世界上所有的科研问题是无限的,或者是说有价值的科研问题也是无限的。但是我们的人的精力是有限的,整个世界的 GPU 也是有限的。要怎么样在有限的 resource 和资源里面找到最有价值的问题去解决,这个才是最重要的一步。所以 apple dex 有一个 HDD 团队叫做 heavy duty discovery。这个团队我们是有 4 time 的员工,跟不同的顶级科学家交流,再从几千个科研问题里面找到最有价值的问题来做。这个可能是我们 apple dex 和市面上一些其他不同公司的一个比较大的区别。
55:32 1
我觉得你这点讲的特别好,真的是我们说 AI for science 科学问题,它是无穷无尽的。刚刚我们提到了生物医药,我们之后还会有一期会专门聊 deep mind 的,他们是怎么去做自己的这个生物医药大模型的那 deep 卖的这条线也很有意思,它从最早去解决蛋白质怎么折叠到现在它是预测药物和蛋白怎么结合的。而且我觉得他也只解决了新药研发流程上偏上游,就是计算预测的这一段。它离真正把药做出来送进临床中间还是有一个巨大的空间的。但是光就这一段,它已经是撑起 30 亿美元的融资了。所以哪怕我们说都做生物医药,它这个里面的问题也是无穷大的。所以科学问题还是很广阔的,包括我们之后还说有什么物理问题,探索太空的问题、材料的问题。对,无穷无尽。
56:26 2
对的。另外我再补充一点,就是我们 apple x 不是做 AI for science,只不过 AI for science 跟 heavy duty server 有非常大的重叠的地方。所以我们就会 focus 上,比如说医药领域和生物领域。
56:41 1
AI for science 跟 heavy duty server 这两个你能不能简单解释一下你们做的方向上的区别是什么?现在有很多模型他们叫垂域模型,他们真的是会用大量某一个具体领域数据训练这个模型在这一个领域里的能力。但我们这边的 happy 的 server,我们还是一个比较通用的模型。我们会强调一些特别的元能力,包括验证能力 verification,包括分析能力、搜索,还有计划 planning 这样的能力。这些元能力我们相信是对真正的一些难题都是有意义的。这些能力这是我们会去着重训练的。但我们不太会针对某一个特别的领域,比如说生物,我们会放 50%的 data,这个是我们不会去做的。
57:25 1
刚刚魏彬你提到的有一个小细节我非常感兴趣。就是你说 AI 还有半年他就能完成自我的进化跟提升了。这句话我当时觉得很有意思,但是你能不能详细的解释一下它是什么意思?
57:39 2
对我说的半年是说最快可能半年之内能开始把闭环跑通,闭环的话我觉得难度最大的其实是 post training。我觉得在半年之内它这个闭环能跑出一环。如果说 RSI 这个 R 是 recursive,要跑很多很多环,但我觉得它跑完一环应该是半年到一年左右就能做完就比如说我们这的模型可以在随便一个陡门,就比如说 coding for material ed,可以在这里面发现自己的写的代码会有什么问题,会造很多这样的训练环境和训练数据。在此基础上自我验证是否这道题训练完之后是有提升一次迭代,他这样迭代一个 loop 一次循环,我觉得半年之内应该是能成功的。因为 anthropic 在这几个月也发过一篇 block 说大概 80%的代码是写的。但是现在有一些问题,这个问题即使是现在市面上最强的模型也没有完全解决。但是从我们最近的一些 observation 和训练的一结果来看,我觉得很快就会有一些突破了。
58:40 1
他指的问题是什么?就是没有解决的问题。
58:43 2
当然这个问题有很多,但我觉得让我睡不着觉的一个问题就是我们怎么知道这个模型在自我进化的时候,它是满足人类的需求,它没有跑偏。这个跑偏可以是说在安全上面的跑偏,也可以是说在目标上的跑偏。如果我们只是简单的说,你给我造一个更好的做材料科学的一个模型或者是一套算法,它可能真的造出来了。但是它在你没有观测的一些点就比如说 cost 或者是说在一些其他的比如说疏水性这种性能上,可能会有非常大的一些 compromise。这个是我比较担心的。因为人和人交流的时候,一般说需求会说的比较的模糊。但是特别是在训练模型的时候,如果你跟模型或者是说这个 evolution 说的比较模糊的话,他可能就会这个用户让我迭代写代码的能力,但我这边碰到了一个瓶颈,但是 anyway 让我换一个方法来达到这个目标。我们要对模型这个行为进行一个监控,是让我觉得最大的一个问题。
59:47 1
你觉得现在某种程度上这两个问题,一个是安全,一个是他达到目标不择手段的这两个能力。这两个问题现在解决了吗?
59:56 2
我个人看来还是没有解决,但我还是一个非常乐观的人,所以我觉得应该是很快就会有解决方法了。
01:00:04 1
然后你刚刚提到这是一个让你睡不着觉的问题,从你的角度来说,有哪些方向的解决方案会让你现在觉得稍微安心一点?我们当然能想到的一个是穷举尽可能多的可能性,但是这个看起来是不是有点笨。
01:00:18 2
对这里也是为什么我们还没有完成全自动化。我其实现在做的最多的一件事情就是在每天工作时间读这个模型的输出和读智能体的每一步的操作。确保它每一步的操作或者是说整一个大概都在我可以理解,可以控制的范围之内。一旦我发现比如说他这里有一些比较蠢的一些行为,或者是说我感觉有一点不太对的一些解决方法,我就会赶快停下这个智能体的 loop,稍微手动的改一改,调一调,然后让它进行进一步的一个提升。
01:00:51 2
这个的话就是刚刚我们说到的这个蠢方法,但是我现在是首条,未来的话能不能有一个智能体就代替我帮我做这个条对吧?就是现在大家提的很火,也是很搞笑的一个概念,就是员工蒸馏。能不能把我每天做的事情蒸馏到这个智能体里面,或者是甚至蒸馏到这个模型的 capability 里面。我觉得这个 idea 虽然说大家是说笑话,但我觉得是可行的。如果我们在三个月之内能把我或者是说我的同事分流到 apple dex 的模型里面,或者是我们的脚手架里面。那其实有很多我们现在每天在做的事情。不管是读代码、改代码,还是读模型的输出,读智能体的输出,都是能加速自我净化、自我迭代的流程的。
01:01:35 1
我们假设真的把被冰蒸馏了,你会担心自己失业吗?
01:01:40 2
说不担心肯定是假的,但是即使我担心,我其实还是乐观的。当然了,不同的人有不同的例子。什么有汽车代替马车的例子,对吧?有什么 ATNT 自动转接机的例子。但其实我觉得这一次可能跟之前的工业革命有点不太一样,我确实有点担心自己会被代替。
01:02:00 2
我记得非常清楚,是 2021 年我就开始有这个担心了。当时是 GPT3 年代,连 GPT3.5 都没有了。GPT3 被微软放到了 D 卡 co pilot 里面。当时我打了一个 function 的名字,然后他能把整一个 function 给我补全。
01:02:17 2
当时我还在读博士的最后一年,我就觉得我整个人就瘫在椅子上了,我觉得完蛋了。我毕业即失业,我这整一个 PHD 整一个博士学的东西,他都能一行帮我补全。那我以后是不是就没工作了?但是你看现在五年之后,我还在这里,我还有工作,只不过我 day to day 每天做的工作不一样了。我不在一个 function 的写代码,而是我会在更高的一个维度,更高的一个层面监控不同的智能体写代码。所以对这个模型会取代我今天做的事情,但他不一定能取代我五年之后会做的事情。
01:02:53 1
对你刚刚提到了,你每天在给模型去评判它的质量行不行,然后去再做验证的这的工作。如果未来有了一个假设,被逼的 AI agent,它可以带你去做监督校验验证的这个环节以后,那其实相当于 AI 就开始自己变成了一个考官。他所有的行为都是在模仿你的这个行为,你的品味、你的价值观去做类似的判断。那是不是说当有了这样的一个 AI 以后,整个这一套就是让 AI 去验证的 RSI,它的这个闭环就跑通了。这就是你说的还有半年的时间可以做到。
01:03:30 2
RSI 的 SI 就跑通了,R 可能还要再多花个一年两年。R 是什么?R 是 recursive,就是把它迭代起来。因为现在即使我们跑通了,我们每一次迭代之后,或者说每几次迭代之后,我们其实还是要人为的去看,有没有之前我们聊过的这个 drift 漂移的问题。所以半年一年我们可以解决这个 loop,但是没有办法完全的解决漂移。但是我还是有信心几年之内这个漂移的问题也可以把它完全解决。
01:04:00 2
现在我们把这个漂移问题可以不停的缩小。假设现在普通的模型每一次可以漂移 10%,如果我们能把这个漂移降到 1%,那就会很好了。但是我们未来的目标是把它降到 0.1%,甚至 0.01,这样我们可以非常有信心。这个模型自我迭代。比如说三个月、六个月之后再回来看它有没有超过,就相当于我们 monitor,我们监控的周期不需要这么频繁了。
01:04:27 1
了解。对那这个应该是整个业界基本上是一个共识,大家都在往这个方向走。然后你觉得在整个走的过程中,其实我们刚刚提到了现在 AI 自我进化最后的一道坎儿。一个是提出问题的品味,一个是判断结果可不可信。其实这两个方向你们都在押注,一个是 discovery,一个是 verification。那你觉得这个品味它是谁的品味?它是科学研究员的品味,还是说它是创始人的品味?就是这之间它是怎么互相体现的?
01:04:57 2
OK, 这是一个很好的问题。我觉得现在来说大部分是 AI 研究员的品味。但是研究员的品味是被我们叫做 indirectly 被创始人的品味影响的。因为陈天桥陈总他在选择研究员的时候,肯定会根据自己的品味选择研究员。但是这一些我其实都不担心,因为品味没有对或者是错的区别,也没有好或者坏的区别,就只有适合和不适合的区别。
01:05:25 2
这是第一第二是不管怎么样,这个模型虽然说现在是用我们的数据或者是说我个人来监控这个模型的行为,但是未来我相信我们把这个线放长一点,放到五年之后,可能我们的品味对这个 AI 模型的影响会越来越小。就像阿尔法狗在最初训练的时候,是受到训练数据或者是说棋谱的影响很大。但到阿尔法出来之后,它已经不是从人类的品味中学习这个技术了。而是会自我品味、自我回放、自我 reason 来学习自己独特的一套品味。
01:06:02 1
所以 AI 会在它整个过程中再通过 RSI 这个 R 形成自己的品味。
01:06:08 2
对,没错,我觉得我们的品味只是一个我们如果放在训练这个语言里面叫做 warm start,就只是给它热启动了一下,以后 AI 会有自己的品味。
01:06:18 1
对对对,然后你刚刚提到了陈天桥先生对 apple dex 的品味,具体他在工作上主要是关注在哪些方向,他怎么样去保证大家研究的焦点始终是在一些重要的问题上。
01:06:30 2
对,这也是一个很好的问题。陈总在战略方面有非常多的把控,也经常跟我们开会聊和研究以及对齐我们的所有的战略方向。因为我们都有不同的背景,就比如说我之前做过很多年的 AI for science,然后 cymon 之前做过很多年的强化学习。我们总会把之前在学校或者是说学术界的一些习惯带到 apple dex。这个时候陈总就可能会发现,我们的一些压可能和公司的大战略方向不是特别的对齐。这个时候陈总一般都会跳进来跟我们开一个会,指出我们的一些错误,或者是哪里偏离了公司的使命,然后会把我们掰正到正确的道路上。
01:07:13 1
能举一个具体的小例子吗?比如说我们 heavy duty server 本身,就是说它应该有很强的推理能力。所以当你碰到一个问题的时候,你应该先去把这个问题分解,再去进行搜索,搜集相关的信息,再去总结这些信息,然后去给出答案。这是比较合理的一个 high server 或者一个比较强的注重推理能力模型的行为。但是我们之前很多的时候为了注重它的搜索能力,所以我们放入了很多搜索的相关的数据。然后模型的行为会上来去进行搜索,而不是上来先去仔细思考这样的问题,把它分解成一些子问题,然后再进行搜索。所以这从行为上,陈天桥陈总自己去用这个模型,它就能看出来这个模型的行为并不是真正的 heavy duty server 的这样的一个行为。所以从这个时候我们就要去改变这个方向,首先我们要去改行为,不管从数据还是从 agent 等等形式上。
01:08:09 1
这里也涉及到我之前说过的,我们模型的宪法,基本上也是陈总自己制定的。这个我们也是用到了,比如说模型的训练,各种调优里面都会用到陈总参与撰写的这个 constitution。对 OK 了解之前,我知道两位马斯克也是大家的老板。然后你们觉得马斯克的风格跟陈天桥先生的风格有什么不一样吗?
01:08:31 2
我觉得他们性格来说是比较类似的,但是陈总他的眼光或者是说对看待问题的方法跟马斯克很不一样。就比如说陈总非常注重 AI for science,或者是说 heavy duty server。这个马斯克其实之前跟我们说过非常类似的话,当然他的原话不是这个 heavy duty,他会用一些其他的 terminology 说,但是说的话和做的事其实不太一样的。就比如说大家可以看到马斯克特别喜欢在 X 和 twitter 上发文,他经常用 AI 做一些小的,比如说画一些图或者是回答一些问题。马斯克对这些非常的上心,他甚至之前可能会每一周都会问一下 broke for x 发展的进步是怎么样的?所以他其实是非常注重 chat 的这个 feature 的。
01:09:19 2
但是陈总他说的和做的其实是非常一样。他口上说非常看重 heavy duty service,他的 focus 就是 heavy duty sober。他对做聊天模型视频生成图片生成一点兴趣都没有。所以这个我觉得是非常 align 的地方。
01:09:36 1
非常专注。对的,陈总这边基本上从头至尾一直就是强调做 heavy duty server,也跟我们说像图片视频生成,这个目标基本上是正交的,所以我们根本就不做这些方向。谢谢大家,我觉得这期非常精彩了。
01:09:55 1
在聊完这期节目的时候,我始终在想品味的问题。Simon 的那句顶级科学家不是看发了多少 paper,而是看最好的那篇 paper 的质量有多高。它其实点出了一个更大的问题。就是说如果现在 AI 的品味,它是从人类顶级科学家那里的热启动的,那么这个品类它本质上可以说还是被少数人去塑造的。那么未来这些面向更加普罗大众的,比如说这些 to c 的 AI 它们到底应该代表谁的价值观呢?关于 AI 的哲学思考,也是我们这个时代急需的讨论。大家有什么样的评论与想法,欢迎给我们留言。播客的听众可以通过小宇宙、苹果播客、喜马拉雅、蜻蜓 FM、spotify 来收听我们视频的听众可以通过哔哩哔哩和 youtube 搜索硅谷 101 播客来找到我们。我是红军,感谢大家的收听。
Click any line to jump · Hover to ask AI
Content Overview
对话探讨了 AI 通过自我学习形成独特品味,及其在科学领域的应用潜力,特别是解决复杂问题的能力。陈天桥领导的 Apple Dex 项目聚焦于重型服务器,强调模型验证和深度研究,与马斯克关注聊天模型和图片视频生成形成对比。嘉宾 Simon 和贝斌分享了 AI 自我进化在代码编写、推理及科学难题解决方面的进展,以及面对的挑战,如递归漂移。他们强调顶级科学家品味对模型训练的重要性,预测 AI 将在科学发现中扮演关键角色。同时,讨论了 AI 自我进化中的安全和目标偏差问题,以及通过监督和验证机制解决这些挑战的策略。未来,AI 可能替代某些人类工作,但也将创造新岗位,展现技术的快速发展与广阔前景。
#### Speaker Summaries
发言人1
概述了硅谷 AI 技术的最新进展,聚焦于 AI 自我进化(RSI)概念及其在攻克复杂科学难题上的潜力。他指出,Anthropic 公司已证实 80%代码由 AI 自动生成,预示着 AI 不久将能自我设计和训练下一代 AI。他还介绍了 Apple Dex 公司,该公司致力于开发“discovery model”,旨在解决无标准答案的科学难题。他强调验证能力和搜索能力对 AI 模型的重要性,并提出通过 agent 团队和冗余系统提升模型准确性和可靠性。最后,他探讨了 AI 品味的塑造,认为它应从顶级科学家的指导中汲取,并引发了对 AI 价值观塑造的哲学思考。
发言人2
他对 AI 模型自我进化持乐观态度,认为这并非新概念,且已有多年研究基础,如智能体优化、强化学习等。他指出,随着模型能力增强,自我进化变得可行,尤其在代码编写、推理等方面。尽管存在担忧,如模型可能偏离目标,但通过监控和验证,问题可逐步解决。他强调,AI 的品味和人类偏好影响模型发展,未来 AI 将形成自我品味。他看好 AI 在科学领域的应用,如材料科学,认为 AI 将帮助解决有价值的研究问题。同时,他相信 AI 虽可能替代部分工作,但也会创造新的职业机会,人类将转向更高层次的监控和指导角色。
AI 自我进化 RSI 递归自我提升 模型 代码 推理能力 长链推理 探索 训练 数据 基础架构 算法 coding 长城任务 上下文 蒸馏 人类科学家 验证 递归漂移
Content Overview
从ChatGPT掀起生成式AI浪潮到现在,不过短短两三年,AI能力的进化速度已经让"AI自我进化"这件事从科幻走进了现实。上个月,Anthropic在一份公开报告中预测,AI未来将进入"递归自我提升"(Recursive Self-Improvement, RSI)阶段,并呼吁人类共同为AI的发展设计出一个减速或暂停机制。
AI自我进化会以多快的速度到来?未来的AI,它会在通往真理的道路上与人类并肩作战,稳步破解医学、气候等种种难题,还是会在暗处走向失控?
本期播客,泓君邀请到专注做“发现模型”的AI公司Apodex的两位首席科学家,杜少雷和Beibin,一起聊聊AI的自我进化与自我验证。
Apodex是一家陈天桥出资创立并亲自主导的公司,这家公司给自己的定位也非常的特别,他们只做一件事—— heavy duty solver,意思是专啃那些没有标准答案,人类自己都不知道从哪下手的难题。他们管自己想做的模型叫做 discovery model。不是从已知的信息里面找答案,而是要提出人类还没有想到过的假设,自己想办法去验证它,去解决这个世界上还没有被解决的科学难题。
嘉宾预言,最快半年,AI就能跑通一次完整的自我进化闭环。但要实现持续的、可靠的递归提升,模型必须具备“自我验证”能力。这很像人类科学家的基本功:大胆假设,小心求证。而要让AI做到这一点,关键的前提是——教会大模型真正拥有科学家一样的品味和判断力。 【主播】
泓君,硅谷101创始人,播客主理人 【嘉宾】
Simon Shaolei Du(杜少雷),Apodex推理模型与训练首席科学家,华盛顿大学计算机科学与工程学院副教授
Beibin Li (李辈滨),Apodex自我进化与编程首席科学家
【你将听到】 自我进化背后的底层能力 03:00 AI自我进化不是新概念,两三年前就有了 06:48 RSI概念火了,背后是模型能力变强了,长程任务表现更好了 09:20 技术上如何训练AI做好长程任务?算法+数据+infra 12:45 Coding能力代表了模型自我进化的底层能力 14:29 用自我验证规避“递归漂移”,代码领域相对可控 16:21 Apodex的验证方法:多个子agent互相验证 19:11 自我进化三条路径:预训练、后训练、Harness 23:56 另一项关键能力DeepResearch,Apodex如何做到多个榜单第一? 29:19 技术范式决定了多个agent组团解决问题效果好于单个 31:18 模型自动进化后,会碾压agent团队吗?垂直领域护城河仍在 自我进化关键一步——学会提问 34:19 Apodex定位:用Discoverative框架解决人类未解难题,不把Token当生意 36:18 “发现模型”最难之处:提出超出经验范围的假设,并去验证 37:52 让AI像科学家一样提问,需要模型有更好的品味 43:31 如何避免大模型拍马屁?远离大众偏好 46:30 “AI宪法”定义性格,顶级科学家数据校准品味 巩固品味,阻止“跑偏” 51:33 AI巨头都在做科研发现模型,判断问题价值是关键 55:32 不同于AI for Science,Heavy Duty Solver是通用模型,强调元能力 57:25 最快半年能跑通自我进化的第一个闭环,但解决递归漂移还需要2-3年 58:43 让科学家睡不着觉的问题:如何防止AI“走火入魔” 01:00:04 解决方案仍靠人工手调,“自我蒸馏”也许是个方法 01:04:28 人类只是warm start,未来AI将形成自我品味,就像AlphaZero 01:06:18 陈天桥与Apodex:制定“宪法”,聚焦Heavy Duty Discovery 【硅谷101正在招聘】
《硅谷101》招聘多个全职岗位,欢迎加入我们的超酷的深度内容工作团队!
👉🏻点击查看招聘详情
!Image 3 【硅谷101听友群】
终于终于终于,大家一直呼吁的硅谷101的社群要上线了!欢迎大家加入。
请用手机相机扫码;如已安装飞书/Lark,可直接在App内扫码进入申请表单。7天内审核,通过后邮件同步入群方式。期待和你在群里碰面! 【监制】
泓君 【后期】
Amei 【运营】
朱婕 【BGM】
Light-Footed - Bonnie Grace
Reclaim - Megan Wofford
Charcoal Stream - Curved Mirror 【在这里找到我们】
公众号:硅谷101
收听渠道:Apple Podcast|Spotify|小宇宙|喜马拉雅|蜻蜓FM|荔枝FM|网易云音乐|QQ音乐
其他平台:YouTube|Bilibili 搜索「硅谷101播客」
联系我们:podcast@sv101.net
Special Guests: 李辈滨 and 杜少雷.
Make your daily reading actually fit you.A daily brief built from the sources you follow. Get started free
00:00 / 00:00