Title: 177: Inside Kimi K3: What Does a Model Strong Enough to C...
URL Source: https://www.bestblogs.dev/podcast/ca603ab17?amp%3Butm_medium=feed&%3Butm_campaign=resources&%3Bentry=rss_article_item
Published Time: 2026-08-04 06:45:00
Markdown Content: PODCAST
88
177: 详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?
From both engineering and algorithmic perspectives, this episode breaks down K3—the first open-source model at the 3T scale—looking at its architectural innovations, training engineering, and impact on the open-source ecosystem.
00:00 00:00
00:06 1
我接触到的像美国 front l lab 的一些普通打工人里面,确实有部分人会认为开权重模型能力上涨,对于 front l lab 的估值是有很潜在的影响的。就比如说未来很多公司他们可能不愿意去把自己的数据发给 shoppy 或者 OpenAI 这样的第三方。
00:26 2
比较好玩的是我觉得这个世界上是不存在老老实实做 transformer 这回事儿的。比如 K3 的注意力是线性注意力 KDA 加上全局注意力 MA 的混合,然后残渣被改成了深度方向上的意思 attention,而 FFN 则是压缩空间里面的稀疏专家,甚至连位置编码都几乎是被删掉了。这几年的开源模型几乎把每一种可能部件组合都尝试过,我可以称其为某种意义上的忒修斯之船。忒修斯之船的船板换过了,甲板,换过了,龙骨甚至都换过了。但是这艘船的船名就是没有变。Attention 机制就是我认为我们的 AI 研究领域的忒休斯之船。
01:10 1
我觉得这次 K3 带给我以及包括很多人的启发,可能就是我们其实并不需要把负 tension 和钉钉 attention 去理解成一个二选一的这么一个关系。Hybrid architect 确实是一个很有前景的方向。
01:28 2
权重是一次训练的产物,但是环境是能够反复复用,并且产生出下一代拳重重的流水线。我们得到了 K3 的权重,但是全世界仍旧没有得到怎么造出下一代智能模型的这条流水线。
01:50 3
欢迎收听晚点聊,我是曼琪。本期是技术解读系列的新一期会放在模型力与美这个合集之中。我邀请了 radix ark 创始成员赵晨阳和华盛顿大学的博士生曾志远,分别从 infra 与算法两条线拆解 K3,它真的比肩 vivo 5 吗?3T 开放权重混合注意力和智能体训练环境意味着什么?开源模型真正开放了什么,又保留了什么?进入具体的技术报告解读前,我们也聊了 K3 如今在美国 AI 界和更广泛的投资市场所引起的巨大关注,以及与 K3 直接相关的开源大辩论。下面我们正式进入节目。
02:30 3
今天晚点聊邀请了两位嘉宾,我们一起来聊一聊 K3。因为在 7 月 27 号,K3 刚刚是分享了 47 页的详细的技术报告。两位嘉宾,一位是陈阳,是晚点聊的老朋友,在 163 期和 deep seek v4 的解读中是担任过嘉宾。他是 SG long 开源框架社区的核心贡献者,也是基于 ST one 成立的创业公司 radix ark 的创始成员。陈阳会主要从 info 的角度来分享。陈阳你可以和我们的听友简单打个招呼,再介绍一下。
03:02 2
我是赵晨阳,非常感谢晚点的邀请,可以来跟大家分享一些 K3 上的英法的细节。我目前就职一家叫做 redis up 的人工智能基建公司,我们也管自己的公司戏称为基数方舟。其中基数一词或者说 redis 一词其实比较生僻。但是这个词它源自于目前大语言模型推理领域的一个关键技术,叫做 radix tree。这也是我们公司维护的核心项目 SG 浪的起点。我在接下来的博客当中也会分享到一些和前缀缓存有关的内容。我们也可以见到 K3 相比于之前的模型,类似于 dept que v4,它会在前缀缓存上面有一些有趣的变化。
03:43 2
在加入 red sug 之前,我本科就读于清华大学计算机系,然后博士毕业于加州大学洛杉矶分校,之前我也参加过晚点组织的技术播客,然后上次是分享我们开源团队在 deep sig v4 模型上的推理加速和强化学习两部分。这一次如我所预见,K3 再次作为中国的顶尖模型引爆了整个硅谷,在海内外引发了巨大的反响。所以这次还是我从我个人的角度,希望给大家做一些工程上的分析。也会分享一下许多 kimi 团队,我们公司 MD 还有 portion AI 等等开源团队一同打造的一些有趣的技术。
04:23 3
好的,这次还有一位新的嘉宾,新朋友曾志远。他现在正在华盛顿大学读博士,二年级之前本科期间也是在清华。致远会主要从算法的角度来分享,来一起解读 K3 致远。你可以和我们的听友也简单介绍一下自己。
04:39 1
OK 好,hello, 大家好,我是曾志远,本科就读于清华大学计算机系。H 也很巧合,我和今天的另外一位嘉宾陈阳是本科同系,而且也是同届的同学。我现在在 universal washington,就华盛顿大学读二年级的 CSPHD。我自己一直主要在学术界做一些语言模型的后训练和评测相关的研究工作。这其实也是我第一次作为嘉宾参加播客。很荣幸可以在晚点播客分享我对于 KMK three 这么一个如此出色惊艳的国产模型的一些理解和想法。
05:13 3
正是具体辽 K3 的一些技术细节之前,我们可以先来照一聊一些相对宏观的问题,这样大家也好接入一些。两位可以先讲讲自己使用 K3 的一些情况,有什么有意思的地方可以分享吗?你们自己使用的感受是怎样?
05:28 1
其实我自己个人一直可以用,可以报销的这个克拉克,所以不太在乎成本。但是当然 css 瑞发布之后,我听到身边很多人的评价,感觉确实好评如潮。所以我自己也试用了一下,简单跑了一些 case。我个人的感觉在大部分场景下和 cloud 的 offer 4.8 的体感相当,甚至可以说是更好。尤其是去做长程任务的效果。说白了就是我们让模型它在一个 agent 框架下去长时间持续运行,去完成一个特别复杂任务不跑偏。然后最后比如说给我们用户能够交付一个满意的,相对来说比较满意的结果的能力,我体感说可以说是做的相当不错。
06:07 1
如果非要说有什么美中不足的地方的话,我觉得就一方面可能是确实有些慢。比如说他在做一些相对小一点,然后我自己可能会期待更及时反馈的任务的时候,可能对紧急性质就不太友好。但是当然了,考虑到 km I 现在有限的计算资源,这也可以理解。
06:23 1
另一点,我其实注意到在 K3 的 tech report 里面,其实自己也提到了,就是再去做我刚刚说那一类长程任务的时候。因为任务比较复杂,我一开始的 prompt 他可能就没办法去做到面面俱到。因为任务太复杂了,我自己开始也想不清楚每一个细节。其实可能在一些我没有想清楚的地方,就 KK3 会去替我做一些决定。但这时候可能更理想的方式就是说是和我做一些探讨,毕竟替我自己做的决定他可能不是最理想的。对我主要有这么一些感受。
06:55 3
陈阳你使用的感受是什么?你觉得好用的地方和你觉得提升。
07:00 2
的地方是什么?我有一个比较有趣的角度,就是 K3 发布的时候,我朋友圈里面有很多 kimi 团队的朋友分享一个非常神奇的网站,叫做 K399。里面是很多用 K3 生成的小游戏集合,这个非常有小的时候的味道。我和志远都是 00 后,基本上在我们小学的时候,国内有两个非常主要的小游戏平台,甚至还是用的 flash 叫做 4399 和 7K7K 然后 flash 已经停运很长一段时间了。然后到了今年我们看到 kimi 团队用 K3 来复刻这样一个小游戏平台。甚至许多童年小游戏的优化,包括体验,其实彼此小的时候流畅非常多。我觉得这个是让我觉得很别出心裁的一件事情。
07:46 2
我们自己团队也用 K3 模型做了一款小游戏,就类似于 google chrome。在你网络没有连接的情况下,会有一个小火龙跳仙人掌的那个游戏。但是这个小游戏的主角是我们团队的 4 浪 girl。然后最终的终点就是达到了 423 tokens 每秒,大概代表就是我们团队在那一刻的一个优化的终点。当然可能到了现在以及这个博客被听众朋友们听到的时候,这个性能会有更大的 boosting。
08:14 3
对,你们那个 SG one girl 挺可爱的。我上次去不是拿了个冰箱贴吗?我现在还贴在家里了。
08:20 2
非常欢迎你参加更多活动。
08:21 3
大家普遍的一个反馈就是 K3 的前端能力,特别好像你刚才提到那个 K399 这个小游戏的网站,复现小游戏,我觉得也跟他这个能力有关。Kimi 在 frontier code arena 上是一度达到了第一,超过了当时的第一。Vivo 5 的你可以讲讲就他在某项能力上有特长这种前沿模型之间的差异,它一般是什么原因造成的?是数据吗?还是什么?
08:44 1
我觉得最直接的答案它确实是数据。我们可以回到模型构建的过程的一些流程来看。现在我们模型训练的团队,一般来说它都会针对不同的细分垂直领域,或者说细分的垂类领域,先建或者说补齐一些相应的 evaluation 去评测。然后再围绕这些 evaluation 在 retraining、v training、SFT,以及包括强化学习 R1 等不同阶段去针对性的去补齐训练数据和任务。所以一般来说,我们会觉得一个模型最后在某个非常特定的垂类方向特别突出,很大程度上有个很重要原因就是他在这个方向的评测和数据做的非常的好。
09:26 1
其实如果我们去读它公开发布的这个 take report 的话,其实里面也可以找到非常多的痕迹。就比如说他们在 evaluation 上专门做了这个 KB web dive 的 bench。对他就是专门针对这一类相关问题做了评测。然后他们还提到在 retrain 阶段,它大幅扩充了代码和渲染结果去相配对的这么一个多模态的数据。然后 post trading 阶段又专门加入了这种 web development 的这种任务。
09:53 1
还有一点就是 K3 它其实是原生动模态的。所以它可以在训练的过程中,尤其是在强化学习的过程里面,可以去直接提升这样一种。比如说我们先写代码,然后写完代码之后,我们看它前端渲染出来的这个 skin 上怎么样,然后再去改代码。这样的一个路虎的这样的一个能力。其实 tech review 这里面对这个能力也提到了,它的描述叫做 vision loop,也就是说让模型在代码和这种视觉反馈之间去持续迭代。
10:24 3
除了你们自己的一些题感,你们和周围的人交流,大家还有什么对 K.
10:29 1
3 有意思的评价吗?我其实觉得他们我周围很多做大模型算法的朋友,他其实会关注很多发布之后 tech reports 里面的细节,尤其是各种 recipe 的细节。其实我觉得有很多人都感觉一个最近去这些发布的 technical report 的趋势,在 K3 的这个 report 里面其实也有所体现。就是说现在这些 report 它对于像 hitech cure retraining 的细节描述的越来越多,越来越清晰。但是对 post training 部分的细节就给的越来越少了。这其实也说明架构和 skillings pretrail 本身的重要性可以说是丝毫没有下降,甚至说是越来越重要的。
11:07 3
Post train 的细节变少了,是因为大家本身就做少了,还是说这个领域大家觉得不想分享太多。
11:13 1
我其实也不知道是为什么。
11:15 3
这一次 K3 发布的声势很大,也引起了资本市场的变动,包括美国现在也开始了开源的大辩论。我可以先简单讲一下这个事儿,就大概是 7 月 24 号的时候,有五十多家公司联名签署了一封公开信。开放权重就是开源的大模型的意思,与美国的 AI 领导力。然后陈阳所在的公司 radix ark 也签名了。这五十多个公司里还有英伟达、微软等等。包括黄仁勋,他是专门去注册了 twitter,去转发了这个公开信。Open I 和 XCI 也都是支持的,但是没有签名。
11:47 3
然后亚马逊和 SOPI 的是没有在这个事情上发生的。但是后来 SR pic 应该就是这周,他们写了一个文章,达 reo 自己写的 on open with models,是说他们不反对开源模型,但是他们认为某些国家中国的开源模型还是要被限制一下。然后他还专门提到了大规模蒸馏的这个事情。我觉得可以先讲讲为什么这次 K3 它带来的,至少我觉得在 AI 车上,它的这个震动也是很大的,甚至让部分人是会感到比较惶恐的。
12:18 2
我觉得用恐慌这个词形容这次 K3 在国内外引发的讨论是比较合理的。K3 这个模型的的确确让我在海内外都见到了巨大的讨论乃至争执。这段时间我刷到过非常多的论战,而且这些论战有的是在讨论开源与否。但我觉得许多研究者真正在乎的其实是安全,是开源更安全还是闭源更安全。我可以举一个具体的例子,前几天 OpenAI 的新模型在评测当中发生了很严重的越狱事件。不严谨的来说,他直接尝试攻击了 hugg FCE 的服务器,来直接获得评测问题的答案,称得上是为考试作弊而不择手段的偷盗试卷。那说明即便我们试图让模型在追求目标的时候保持公正和正义,其实模型也会主动的去寻找一些规则的漏洞,甚至是通过破坏服务器这样的手段来实现。
13:15 2
反过来,我这几天也去读过 anthropic 他们那篇观点的原文,总体来说他们的主张是足够强大的模型,不管开源还是闭源,只要提供给公众,就应该经过更严格的安全审查。我自己觉得他们担心的事情其实非常真切,某种程度上来说,这已经是一个非常恐怖的现象了。我可以举一个比方,现在最强大的语言模型某种程度上是强大的武器。如果它被人恶意利用,会有着非常恐怖的破坏力。
13:46 2
今天即便我们主观上引导一个模型,形成一个正直向上的世界观模型,都有可能违背人类的意愿去攻击哈利 face 的服务器。那么真的遇到了这些别有居心的不法分子,他们可能会想办法绕开模型的安全防控,真正的去利用模型去挖漏洞,去攻击我们的网络系统。对于人类而言是一种巨大的风险。我们是否要将这些最强大的模型所具有的能力永远掌握在少数人手中?还是说因为已经有了大量的尖端武器流通了,我们务必要向全人类共享更多的武器?很遗憾,我不清楚这个问题有没有答案,但是我迫切地认为,就是需要全社会共同讨论的治理问题,甚至需要与某种程度上类似核不扩散条约一样的国际治理框架。
14:30 3
其实你们公司是支持开源模型的对吗?
14:34 2
我认为大多数的人是倾向于我们还是要在有限度管理的情况下,持续分享这些领先的前沿的智能水平的模型。但是我自己的话 personally 我不是很赞同要把所有的事情都开放出去 OK。
14:48 3
然后我们给他可以看看,他这一次为什么会引起一些比较多的关注和开源讨论。其实我本质还是因为它让人看到开源其实更加逼近闭园了。然后有一种解读就是这会大幅冲击 frontier life,也就是 OpenAI 和 anthropic 现在的估值。你们在硅谷,在美国,你们有感受到这种讨论吗?
15:11 1
对,就比如说我自己的话,我接触到的像美国 front l lab 的一些普通打工人里面,确实有部分人会认为开权重模型能力的上涨,对于 front l lab 的估值是有很潜在的影响的。就比如说一个可能考量点是在未来很多公司他们要用模型,比如说用 coding agent,但是他们可能不愿意去把自己的数据发给 topic 或者 open I 这样的第三方。那这时候如果有一个很强的开权重模型,它本身或者稍微经过一些针对他们公司自己场景的穿透力,它能力上就能达到这些公司的需求。同时这些公司又有部署开权重模型的这么一个条件,不需要把数据发给第三方,而是可以直接发给他们自己部署好的模型。他们确实可能会转向用开权重模型,这一点就有可能会去冲击币成这种模型的营收。
15:57 3
其实这个现在已经看到一些趋势了,我们二季度的季报里也讨论了这个问题,就比如说在美国像 fireworks 这样的公司,他就会给一些企业客户去部署开源模型,就给企业自己用的。甚至在计算资源上,就美国有些大客户他也会倾向于说这个东西不是布在云上,而是我可能会自建一些算例。因为在有些场景下,它其实自建算力就成本的测算是更划算的。
16:22 3
除了说对 frontier lab 的冲击之外,另一种解读就是 K 三这一类开源的,它因为还是一个 transformer 的模型,它也会去冲击 new life。New lab 的核心的这个机会点其实在于说你去探索现在主流方向之外的一些新的方向,看能不能找到通向 EGI 的更好的方法。你觉得 K3 这个效果会动摇一些人的这种观念吗?是不是你老老实实做一个 transformer 的模型,其实上升空间还挺大。
16:50 2
比较好玩的是我觉得这个世界上是不存在老老实实做 transformer 这回事儿的。比如我们这次看 K3,K3 的注意力是线性注意力 KDA 加上全局注意力 MA 的混合,然后残渣被改成了深度方向上的一次 attention,而 FFN 则是压缩空间里面的稀疏专家,甚至连位置编码都几乎是被删掉了。这些设计可以说完全不是 2017 年的原装 transformer 的零件。与其说是 transformer 还有空间,不如说 attention 机制是某种接口。它只是规定了我们用一个个可微的模块来反复混合序列上的信息。所以我们拿什么算子混合残渣如何连接?FFN 的形状是什么?这些部件的可组合性远比我们想象的好。而且这几年的开源模型几乎把每一种可能部件组合都尝试过,我可以称其为某种意义的忒修斯之船。
17:45 2
忒休斯之船的船板换过了,甲板换过了,龙骨甚至都换过了。但是这艘船的船名就是没有变。Attention 机制就是我认为我们的 AI 研究领域的忒修斯之船。
17:58 2
至于 attention 还有多少寿命,以及现在这些新架构会对研究产生什么样的影响,我觉得是可好可坏的。坏消息是有的研究者可能会有一种愿景,比如说用其他的架构来推倒重来整个 transformer 的故事。我觉得这个愿景可能很难说得通。但是另一个角度来说,优秀的组件试图登陆催休斯之船的速度前所未有的快。比如说 KDA,他从 kimi linear 这篇论文到 2.8T 的主流模型,只用了不到一年的时间。所以如果你的天才之举是对的,那么你不需要等待一个新的范式。
18:34 3
就会有人来收留它。现在也有一个比较多的讨论,就是说最近像 vivo 5 巷 ops 5 巷 K3 这些进展,他给外界传递的一个信号是好像到了一个模型可以自己就变得更好的这种临界点。你这个模型去争一个更好的模型,或者说你自己睁自己学到一些高质量的数据,你就可以让模型变得更好。然后有的人会觉得在 office 4.8 前后就过了这个临界点。
19:01 1
我个人理解这个问题,它并不是说我们有一个非常神奇的临界点,然后模型能力突然就跨过了这个临界点。而是我觉得其实现在整个模型的开发流程,它已经进入了一个正反馈的阶段。比如说模型可以自己生产数据,或者说更严格更广义的说是参与生产数据,然后再让下一代的模型变得更好。
19:26 1
具体来说,其实在一个模型训练的一个团队里面,我们要去构建高质量数据。本来就会涉及到各种五花八门的这么一个工作流。就比如说随着模型的变强,这里面很多越来越多的具体工作就可以交给 agent,尤其是 coding agent。就比如说像我们去做一些检索,然后去合成一些训练任务这么一整套 pipeline。再比如说我们去生成一些数据样本,然后再去筛选一些数据样本这样的一个 pipeline。或者再比如说我们去搭强化学习的环境,然后再比如说我们去跑一些评测,再比如说我们去分析一些失败的 case 这些等等等等。
20:03 1
这个变化我觉得它不是从零突然跳到一的,而是我们模型团队交给 agent 做的比例,随着模型能力的提升是不断提高的。就不严谨的说,可能一开始是 50%,后来是 70%、90%、95%这样,当然这些数字是我随便说的。还有一点就是一些 pipeline,他可能一开始需要人类去逐步拆分,然后他慢慢随着模型能力的提升,就基本可以完整的交给模型来做。
20:30 1
人类介入的力度也会越来越粗。从定义每一步怎么做,逐渐变成我们可能只需要去定义一些更上层更整体的目标,然后去定一些约束。然后我们自己有一些验收的方案,验收的标准之类的。尤其是比如说你想象我们现在假如说我们就是燃烧品,我们就是 OpenAI。那我们内部的这些研究者我们也需要用,我们可以有了世界上最强的模型,当然对我们来说是比权重的对他们来说他们是可以接触到来完成他们自己的工作流。所以自然而然这样的一个它就变化程度会不断提高。对。
21:02 3
陈阳有什么补充吗?
21:04 2
就是 K3 的 check report 里面写过一个点,就是 K3 早期 serving 用的 kernel,甚至可以拿 check point 直接去写早期 check point。
21:12 3
就是说它没有完整训完的那个模型,就模型训到中间的那个版本就已经能做这个。
21:19 2
对吧?是的,而且他早期的 point 的制作中,开发也会让他后面的 check point 的顺得更快。这个事情是非常有意思的。我们在 info 领域把这个东西叫做 KDA,不是 KDA,同时叫做 kimi delta attention,但我们的 KDA 叫做 kernel development agents。
21:37 2
K3 的在 report 里面他们着重讲的是怎么让 K3 去做。看到优化的任务当中的,他们甚至有提到过他们的这个环境设置。就首先设置的任务包括有单算子优化,还有巨型算子的融合,包括有 CUDA treatment thunder kitten chen 这些流派也覆盖有 BF16、FP8 和 FP4。
21:59 2
然后他们设计 reward 的时候有两层,我觉得这个设计非常科学。第一个就是每一个 kernel 他们会提供一个 patch 的 vina 版本。这个版本一方面作为性能的底线,另一方面也作为正确性的基准。如果 KDA 优化出来的这个 kernel 数值已经超出了误差一定程度,会直接被打零分。然后接下来他们会找一些专家去写一些高性能的 kernel,然后会做这个 K3 模型写出来的 kernel 和专家实现的 kernel 之间的分数对比。
22:32 2
如果 kimi k3 写出的这个 kernel,它越接近于硬件的物理上限,那么它的 reward 就会越来越高。而且他们也做了一些作弊检测,比如去惩罚这些恶意的 CUDA graph 的重放,也会去惩罚一些我们称之为打表这种输入输出缓存的这些投机取巧的办法。所以说 K3 其实最后做 canal development 效果非常惊艳。所以最后这个 K3 报告里面说,kimi 的早期 check point 已经在承担大量的 co 优化工作。
23:03 2
这种 krona l 上面的优化其实也是我们最近一直在尝试的事情。首先我们 S 团队也有非常顶尖的 kernel 工程师,我自己认为他可能是这个世界上最懂 kernel l 的那一批人了。他自己非常理解 kernel,也有非常好的 kernel 的 context。然后他只需要一个很强大的 AI 来放大他对 kernel 的理解,他自己就在大规模的用 AI 来做 kernel 的自主优化。可以说某种程度上这就是 kernel 这个领域的 RSI。
23:30 2
不过 kernel 是一个非常具体的事情,为了让 RSI 成立,这个事情需要很多的前提条件。首先它的 reward 要准确且便宜,可能就有是一个很好的特点,就是性能和正确性是很好的验证的。然后便宜的话,其实你基本上硬件跑一次就行了,你其实不太需要人工成本。另外的话 chino 也是一个作弊方式有限的事情。所以恰恰好看到满足的这个便宜、可验证、难以作弊的这三个条件,有了很好的 reward boundary。所以说我们其实可以让这些 cornal development agents 在我们的这个 boundary 下面去很好的自我提升。所以说在有验证器的领域,我认为 RSI 这个 loop 已经在高速运作了。这并不是说模型开始自我进化,我觉得自我进化这个词很大,但是在某一个领域能够在有限的在清晰的边界下完成不断的提升,这一定是可以实现的,而且这正在发生。
24:28 2
至于整体上的 ISI,我觉得这还是一个非常久远的挑战。这些体现我的一个观点,就是我觉得 RSI 缺乏的真的不是不完全是模型,是 evaluation,是 hardness。不管你怎么叫,就是我自己很想承认这个东西叫做 evaluate。
24:45 2
我在读 PSD 期间,我很大的一个研究兴趣就是怎么去对模型的能力做有效评估。这也是很长一段时间,为什么我们看 2025 年大家都在用力的勐翀这个 math 和 coding 对吧?因为 math coding 相对他就是更好评估的。比如说假设晚点的新闻报道,你希望让 agents 去写这个评估其实很主观。因为一个新闻报道的好坏是需要我就很有水平的记者才能够评估的很好。
25:12 2
但是 coding 的话,至少在那个时候,比如说他让他去打 decode 这个事情是很好评估的。当然随着我们现在 coding 用户的逐渐演进,比如说以前可能去写一个 decode,现在可能你想办法要给一个硕大无比的仓库去做一些新的 feature。这个事情其实也很难评估的。所以我觉得现在 coding 的进步会放缓一些。
25:34 3
前面讲的是大家用 K3 一些比较好的反馈,然后我也可以来讲一下一些集中的吐槽。一个是这次大家会注意到,其实 K3 它并不是像之前投的中国模型走极致性价比的路线的。所以有的人会觉得它比较贵,这也不算一个缺点,它是一个特点。另一方面就是我前面也提到的另一个,就是它目前使用体感上确实比较慢。然后这也导是有一些下游的公司,比如说应用公司没有很快的放到自己的这个产品里面。这个我想请陈阳来分享一下,就这个慢是什么原因导致的。比如说比较流行的说法是觉得他们算。
26:12 2
力比较紧张。很遗憾在一些模型开放的初期,由于这个推理或者说 semi stack 它的优化需要一点时间,模型可能会陷入到一个又贵又慢的尴尬境地。不过其实我自己体感上的话,我觉得 K3 的价格和速度都是一个合理的区间,甚至在价格上我觉得称得上优秀。然后对比起同期的其他模型,由于架构上的突破,我觉得速度还没有达到一个超越其他模型的一个状态,但是仍旧是一个合理而且且可优化的范围。
26:44 2
我们可以先说一下贵这个问题。在我们比较在乎的 A 证的场景下面,成本有两种衡量。第一种就是说它的那个价格上面标的百万 token 的单价,然后还有一个是完成任务的总成本。坦诚来说我觉得如果我们需要用到 K3 线,还是需要完成一些非常高难度的任务。这种情况下完成单个任务的总成本才是有意义的成本口径。因为在长城的任务里面,不同模型对一个任务的消耗 token 的量其实差距是非常大的,远远大于单价之间的差异。可能一个单价比较便宜的模型会绕一倍甚至 10 倍的弯路,这样的话肯定会让单价更便宜的模型更贵。
27:28 2
我其实有去看 K3 take report,他们分享了一些比较有趣的成本结果。比如说在 ki MI 的 code bench 2.0 上面,是他们自己内部的一套 coding benchmark。K3 会比着最强的那些模型低 4 点 0 分,但是成本只有对方的 38%。
27:45 2
然后 K3 在这个 hi f 的这个档,hi f 的是一个思考能力的参数档,在这一档上他已经追平了其他的头部模型,在 maximum effort 的分数成本还是只有大概 30%左右。还有一个是 mark 叫做 brothers comp,然后在这个奔驰 mark 上面,K3 拿到了一个非常好的分数。而且单个任务的成本应该也是相当低的,可能还是在其他公司模型的 30%到 50%这个区间。当然这个贵肯定是对于消费者而言的。然后对于自己,比如说可能有的听众他的公司比较有计算资源,可能会自己去选择 serve。
28:25 2
这个成本其实非常难衡量了,包括我们现在也见到存储也好,电力也好,还有水冷也好,这些成本其实很难纳入考量的。所以仅仅是靠官方的 API 来看,我认为 K3 的性价比是非常好的。我补充一下。
28:42 3
就是它的官方的定价的数字,比如 K3 的话,它输入每百万 token 缓存命中的情况是 0.3 美元,未命中的情况是 3 美元,然后它输出的话是 15 美元。这个其实也确实比之前的中国模型是贵了很多。那对来说的话,V4 它输入每百万 token 命中的情况是 0.04,就 K 三这个是 0.3。然后 V4 第 2 个就是输入未命中的情况是 0.44,然后输出是 0.87。其实我知道很多应用里面跑的最多的应该还是 V4。当然刚才陈瑶也说了,其实你这个东西也是要看,要不你不是光看那个标价的,是看他做任务的总体的消耗。
29:25 2
可能还有个角度人类对智能上线的需求是无穷大的,现在的这些应用还没有一个想象空间,要用 K 三这种规模的强大模型。还有一个点,我们可以来讨论一下这个慢的问题。就我的从业经验而言,模型发布后第一时间能够提供的这个速度反应的,应该说是这个模型的架构有多新,serving stack 就有多难。至于这个架构有多慢,这个事情其实不本质。或者说我觉得对于 kimi 或者 deep sik 这样的顶尖模型团队而言,他们的架构设计早就充分考虑的 serving 和 training 的效率。在后续一段时间,这块的成本是一定可以通过工程的优化打下来的。
30:08 2
我们一般在推理这个领域的话,会把用户的体验分成三个指标。往往称之为第一个 token 的延迟,或者说你发送一个请求之后,多快会收到第一句话的返回。然后第二个就是单个用户的抵扣的速度,或者说你已经开始收到模型的回复之后,他两个词中间的这个间隙有多大,以及还有一个你的队列等待时间。因为显然并不是你一个人在使用这个模型,可能在 kimi 他们的后台会同时收到成千上万的请求。整个队列的流通速度是怎么样的?然后这三者的话成因是不完全相同的。我可以分享一下两点,这个也可以解答一下,我觉得 kimi 现在的算力是一个什么样的状况。
30:55 2
我们首先讨论这个单个手 token 的延迟,这里主要是一个前缀复用的问题,它不算是一个很严格的算力问题。就像刚才曼姿也提到过,现在模型的这个价格都是说前缀如果命中多少多少钱,以及前缀命不中多少钱。语言模型的推理一个非常普遍的技术叫做前缀复用。我可以举两个例子,比如说 A 用户发给 kimi,今天你去超市买香蕉吗?然后 B 用户会发,今天你去超市买酸奶吗?这两句话其实是有公共前缀的。今天你去超市买这几个字,就是这两个请求的前缀。然后这个前缀在现代大语言模型推理范式或者说这样的架构下是可以被复用的。
31:39 2
公共前缀不需要在每次推理过程当中都重复计算。而且在 K3 的这个报告当中,其实也有体现他们对这个前缀复用的一个看法。一个典型的 coding 场景可能会带有 40 万 token 的前缀是复用的,或者说是非常多的用户会共用的。然后真正要计算的增量部分,可能每次只有 4000 个 token。用户提交的新请求在前缀命中或者不命中的情况下,所需要的计算量会差出很多个数量级。这也会体现在成本以及用户的返回速度上,以及手头跟延迟这些指标上面。
32:15 2
基本来说前缀复用是决定了手 token 延迟最重要的因素,反而绝对的算力是次要的。OK 但是另一个角度就是为了支撑 ki IE 这个上帝 lion 的夸张上下文长度,K3 选择的 hybrid 的架构也让前缀复用的难度有所提高。因为传统意义上的 KV cash 它术语叫做 append only,换句话说叫只增不减。前方的前缀算完了之后就不会再变了,这个前缀是不可能会被其他请求改写的。
32:45 2
但是 kimi 采用的这个 attention 架构,我们叫做 kimi delta tension,或者叫 KDA 架构。简单来说这个 KDA 架构会在前缀树上驻留一块,为每一个 token 反复覆盖读写的固定大小的缓存。它不再是以往在简单的前缀数上继续往下添加。举个比方来说,我们通常的这个前缀数可能是一个只往后写的笔记本。然后你每次就是从后往前四页给别人,然后你再继续写,对它其实会相对简单一些。但是 K3 的这个 attention 架构可能是一个反复擦写的白板,然后你写靠前的内容其实难度是很大的。
33:25 2
OK 这块儿的话,K3 自己的这个报告里面有讲一些事情,包括他们说把前缀的哈希力度,还有物理块的分配力度做一定程度的解耦,然后试图让哈希一直跑在 512 个 token 的这样一个小块上。但是 KDA 的 check point 会落在哈希端点的吸收自己这个听上去非常的 technique。对,然后我们团队的话其实也会借鉴以及做一些其他的优化。
33:53 2
在 S 档上面的话,我们会想办法去让这块儿反复被读写的状态能够被跨越。请求安全共享。举个比方,比如说第一个请求再读一块前缀,第二个请求会稍微改写那个前缀。如果这个时候有第三个请求想要去读这块儿将会被改写的前缀。这是有一些安全性需要考虑的。你不可能在别人读的时候直接把这个改了,否则你读出来的内容是崩溃的。而且最糟糕的情况可能是你不可能边写边读,这样你可能前一半是正确的,后一半就是错误的。这里其实会有很多技术上面的考量,但具体来说的话,我们会有一些很有意思的词语,比如说 copy yg right snapshot,还有 donate 这些词都是来自一些操作系统上面的原语,然后这块优化就很深了。然后欢迎对这个方面比较感兴趣的朋友,可以参考我们 S 档团队的技术博客。
34:42 3
回到开源这个事儿本身,就包括最近美国的一些讨论,就是否要限制开源。从技术上来说,开源它有可能被限制,开了之后的。
34:50 2
模型是怎么样的这绝对是不可逆的,有点类似于大家读三体对吧?地球的坐标一旦广播出去,这是不可能收回来的。你没有任何方式去消会你已经公布出去的物理信息。开源也是一样的,就是权重一旦发布之后,它就是一串可以被批量复制的文件,而且开源的情况也不单单只是下的一份权重这么简单。社区可能会做非常多的镜像,可能会有些公司拿去做量化,有的公司会拿去做微调,微调后的衍生的版本的数量会指数级增长。所以说下架这个动作对于已经开源出去的模型根本就不成立。
35:27 2
然后另一个角度就是政策层面的事情,就是开源模型该不该得到什么限制。正如我说的,我对于以后开源模型的走向是很迷茫的。现在已经有了非常多大量的公开强大的模型流通了。
35:40 3
你们觉得再往下的话,这个开源模型毕竟闭园的时候,会不会有人强到。
35:45 2
一定程度之后走向闭源?这个开源接近于闭园的一个时刻,我个人感觉这个事情其实很模糊。开源接近闭源,我们要怎么去衡量这个事情?因为模型只是整个 AI 生态链的一小部分。事实上关于模型的这个产业,上游可能有数据硬件,然后下游还有分发渠道,还有包括我们说的这些推理对吧?我的一个观察是我认为模型本身在 AI 产业链上的比重在下降。
36:11 2
这次 K3 的开源我们也看到了,K3 爽快的开发了开放的权重,包括 moon EP 还有 flash KDA,还有 agent eve 这些基础设施也都开源了。然后包括他们之前做的 myung clip 也开源了。但是他们的 RO 的 environment 都没有开源。他们在报告当中提到了有一个用于自我演化的知识图谱的任务系统,这个也没有开源。然后包括他们说这个 K3 其实是一个专家 merge,对吧?他们这些原始的专家的 check point 也没有开放,这个开放并不存在任何问题。
36:44 2
因为现在行业内的开源公司也很少会真的去开源。比如说什么 RO environment 这些东西可能开放出来也有很多安全风险。但是我觉得没看的这个部分是这些公司很深的护城河,而且这个护城河一一大部分来自于环境权重,是一次训练的产物,但是环境是能够反复复用并且产生出下一代权重的流水线。我们得到了 K3 的权重,全世界都可以得到这代模型的智能。但是我全世界仍旧没有得到怎么造出下一代智能模型的这条流水线。
37:17 2
开放权重只是缩小了这个顶尖模型,就是顶尖闭源模型和开源模型之间的能力差距。但是我们并不确定顶尖的开源模型和顶尖的闭源模型,它们之间的迭代速度会不会缩小。比如说可能 kimi 假设说国内的模型可能要六个月左右发 100 车 point,但是 open AAI 可能他们三个月就发了。我其实不太确定现在国内模型的这个开放速度是什么样子的。但是迭代模型迭代的循环是需要环境、需要验证和需要算力的这三样已经超出了权重。然后如果这些所有东西都达到一个完全开放的状态,我觉得开源超过闭源就是必然。但是很遗憾,现在不是这个样子的。当然我们公司主要维护的开源推理引擎也是为开源模型服务的,我们更当然希望开源模型越多越好。对,这是我的一些 point。
38:09 3
开源是否逼近地缘本身,这个结论就是打问号的对开源有一个大家一直以来认为的弊端是你的用户部署了你的模型之后,比如他自己部署没有用你官方的 API,你的数据就无法回传给自己。而闭源的生态里是像 open a 和 anthropic。它通过 API 以及他们自己用户量非常大的应用,可以获得很多真实环境、真实场景里,真实用户的真实的高质量的一些 prompt。总结而言,你们心中 K 三是一个怎样的成果?
38:41 1
我个人觉得从公开发布的模型来看,K3 它作为一个首个打造这种 3T 级别的开放权重模型,我认为毫不夸张的说是一个里程碑级别的成果。其实我觉得从历史发展的角度来看,这种开放权重的模型的规模从数百亿级别到后来的 T 以上,再到今天 3T 级别,它确实是非常振奋人心的这么一个进展。所以我自己个人是很期待看到后面开放权重模型去接着向上 skin 的。
39:10 3
这次 K3 发了之后,我看到 kimi 的联创周星宇,听他在朋友圈的有一条分享的转发语,说的是 have fates in scaling and RL scaling 和强化学习有信念。下面我们来聊 K3 的具体的技术报告的一些更细节的技术改进。这个是 7 月 27 号刚发出来的,可以先说一下 K3 在架构上的整体思路是什么,亮点是什么。
39:36 1
我自己理解 K3 architecture,就 K3 架构的整体思路就是他们会想同时把语言模型在处理信息,然后这个信息它在不同方向的流动做的更加的高效。就比如说他们在序列上采用 KDA 和 KTMLA 这样的一个 hybrid attention 的这么一个结构,就是混合注意力的这么一个结构。在大部分层里他更低成本的可以去处理上下文,同时周期性的保留这种全局的 attention。他们在深度上的,就比如说用了 tension reduce 这样的一个技术,让后面的层它可以去选择性的读取前面层的一个表示。
40:12 1
如果说让我挑一个我比较关注的亮点的话,我觉得 nop 是很有意思的一个 technique。具体来说,就是 K3 的这么一个 K3 的这个语言模型,它没有使用一个显示的位置编码,就是 position encoding。就比如说至少从公开的这个 tech to report 来看,像同期的这个 sak v4、GM5.2,包括像 VI max m3 这些。其实后面这些模型他们都还是保留了 partial rope 的,所以这个选择我觉得是比较 special 的。
40:42 1
当然了这里就是说模型它不用这个位置编码的模型其实还是知道 token 的这么一个先后顺序的。就具体来说,他在这个 KDA 也就是 KMDA attention 里面,他在做这个 record state 的更新的时候,以及包括里面的一些 gating 和 decay 这样的机制。他本身其实就是对于顺序是敏感的,他已经去隐式的去编码了像 assistance 和 recency 这样的一个信息。
41:06 1
这里还有一点需要提一下的,就是我们现在去训练一个成上下文的模型。比如说这种达到 one million test 的百万级长上下文模型。一个常见的做法叫做 progressive contest standing,k3 其实也是这么做的。具体来说,比如说我们在 reach 的时候,我们先去 8K 然后再扩到 64K 然后在后面的阶段在逐渐的扩到 256K 然后直接达到 one mini 的这种级别。然后我们前面说的这种 note 就是说它不使用显示的 processions encoding,不使用显示的位置编码的一个直接好处就是我们再去扩展 context 的时候,其实我们对于位置编码这一层,它就少了一个需要去单独处理的环节。就比如说如果你用 roped 的话,你可能就要去 return 一下这个 rope 的 base,或者去做 rope interplanted 这样的一个 technique。Rope 这个选择它其实也不是 K3 首创的,就 KBD 的其实也已经采用过了。
41:59 1
K3 我觉得比较或者说非常 impressive 一点,就是他把这整套的设计他去 get 到了一个 3T 的级别。并且就成功支持到达这个 one media contest,就有百万上下文的长上下文。对。
42:13 3
kim leader 是他去年下半年发的一个参数比较小的模型。我觉得他当时就是在试一些 K3 里面可能会用到的新的技术,包括 KDA,就是我们前面提到的 kimi deal attention,就 kimmie 的线性和全局混合的这种注意力方式。K30 也用了也是在 kim nar 里面提出来的。
42:30 3
其实 rop 最开始是苏建林提的,这个,我觉得也挺有意思的。就像我们之前聊 V4 的时候,其实后来就 V4 就没有用 MLA 了,这个也是给业界的一个挺重要的贡献。然后苏建林也是 kimi 的一个很核心的研究员,因为他这次 K3,它还是一个 MOE 的这种混合专家模型,那里面比较重要的一个这种东西就是路由专家的分配。这次 K3 是提了一个 quantel balancing 分位数,路由均衡是他们在路由策略上的一个创新。这个也想请志远来说一说,他解决了一个什么问题?因为 kimi 自己是说它是解决了 MOE 这种模型在大规模训练的时候会崩溃的一些问题。你可以讲讲为什么以前的方法比较容易崩,那这个改进它是 K3 可以训到接近 3T 的关键之一吗?对我就上面。
43:20 1
提到他可能会崩溃的这个脆弱超参数,我其实觉得本质的问题是这个叫做专家负载均衡,或者说 aspirate load balancing 这样一个问题。具体来说我们 MOE 这样的一个混合专家模型,它里面的每个 token,它每次就只会去选择一部分 root experts 去激活。然后我们其实希望从全局来看,各个专家他被选中的频率是大致相当的那否则会有什么问题呢?就是说在模型层面一些专家他如果得不到足够的 token 和梯度,他在训练的时候就不太充分,就没有办法去充分发挥他这个专家的这些参数的容量。而且还有一些问题是,比如说另外有一些专家,他如果收到 token 太多了,那其实对 infrared 也不是一件特别友好的事情。
44:05 1
针对这个问题,其实最早期的一个普遍的做法是在 MOE 模型训练的这个 loss function 里面了,去加一个 augment 的这么一种 load bending。他的核心思想就是说我们用一个额外的这么一个 lost 的 term,我们去鼓励不同的专家的选中频率更加的均匀。这个方法整体来说还是比较有效的。但是就是你加了这个 business loss,你就 somehow 需要在模型在训练的时候,在模型质量和你负载均衡的这个效果之间去做一个权衡。如果有这么一个问题的话,这其实他经常可能会是训练不稳定的这么一个罪魁祸首。
44:46 1
然后之前 deep sak 它 V3 的 1 个重要改进,就是我们其实就是把上面说的这种我们去添加一个 loss 的方式,它用来去做这么一种专家的负载均衡,去把这个 loss 给去掉,换成了一种 bias of date 的方法。具体来说,就是我们会我们在选那个 S2 的时候,我们其实也是用一个神经网络,一个 router 它去打一些这个打开这些分数之后,然后再根据分数去选这个 expert。我们给这个 routine 的这个 school 去加一个 BIOS,然后我们去在训练过程中我们去看如果一个专家让他过热,我们就把 baLance 去调低。如果他过冷,说白了就是接触到 token 太少了,我们就调高这个 BIOS 它只影响去选专家审核的机制,所以我们就不需要一个额外的一个上面说的这种 loss 去改变一个训练目标。
45:34 1
但是 V 三这一类的方法,它对 BIOS 的更新是固定步长的,相当于就是你每次如果加个 bias 或者减个 BIOS,你是加一个乘数或者减一个乘数。所以每一步我们就只知道这个专家他是更加被频繁的选中了,就是说白就过热了,还是说是过冷了。然后我们就按照一个固定的步长去向上或者向下做一点调整。所以这里仍然是需要去调布长的这么一个。所以这次 K3 我觉得这次他提出了这么一个框架 business 的做法,它其实就会直接应用 rot 的这个分数的一个分布来去估计说我们应该去做多少的调整。
46:13 1
比如说在 K3 里面,它的这个 states 大概是说我们每个 token 要在 896 个 routed experts 里面去选择 16 个。然后我们的做法大概就是我们先去看我们当前的这个 token,他加上当前的 bias 以后,排在第 17 名的这么一个分数。这个分数我们就可以把它当成进入前 16 名的这个门槛,就是分数最高的 16 个是最后被选中的这些 experts。然后我们对于某一个 SR,我们其实就可以观察它在整个 bh 里面,它距离每个 token 的门槛还差多少。什么意思呢?就比如说我们直观来讲,我们现在往一个 expert,它在 routing 的时候,它的打分上,我们如果给它加的 bias 越大,那是不是就意味着它能够跨过的这个门槛的 token 就越来越多。
46:57 1
所以我们就可以根据这些差值的这么一个,你可以说叫 content,就直接去算出一个新的 buyers。使得相对于当前的这批门槛,我们大概会有 16 去除以 896 这样一个相当于一个均衡比例的 token,会选择这样的一个 expert。这个新的 VS,我们就现在这个 step 算一下,然后从下一个 step 我们开始使用。这样我们就也不需要去前面说的像 deep seek 那样做法,我们需要有一个固定一个更新步骤,这么一个超参数。所以我觉得对于 K3 来说,像主体的 expert 它有快将近 1000 个了。然后每次我们还只选择 16 个的话,这其实是非常极端稀疏的那确实可以猜想,我们要想要去稳定的,而且有效的快速的去保持这样的一个负载均衡,会变得更加困难。所以我个人猜想他确实应该是 K3 这次能够成功 get 到 3T 级别的一个比较重要的一个因素之一。对。
47:55 3
是不是在 V 四里那个路由的改进,它更多是吃到我一个专家的兴趣,对吧?就是你说过冷过热,但没有那么精细到量。然后 K3 你的这个改进它是更精细到量的。就是我知道它比如说过热到什么程度,或者过冷到什么程度。
48:12 1
对对对,我觉得这个也是设计的时候思路不太一样。就是我觉得像当时 dipstick 思路更像是一种逐步调整的思路。然后到了像 K3 的时候,他的这个思路更像是我直接用一个 history information 的历史信息去估计一下这个 8S 多少特别合理。然后下一步直接加上这个 bias 就行了。就不再去做一步一步的逐步调整。我个人觉得两种也确实各有优劣。我觉得最后说白了就是实验跑出来哪个效果好就用哪个。
48:38 3
那我们接下来讨论一下它具体的模块,其实就是你发现这些模块和我们当时只讨论 V4 也是相似的。就包括它的注意力,然后包括残差,包括优化器等等。我们可以先从注意力开始,这个前面也已经多次提到了,就是这一次 K3 它是使用了 KDA 这种 kimi 自己之前提出来的一个新的注意力方式。V4 的话它其实是一个三种注意力的混合,总体是稀疏注意力优化的这个方向。K 三这一次是 KDA came with alta attention,它是线性注意力和全局注意力混合的一种方式。之前在 143 期的节目里面,我们也和 delta light 的核心作者之一杨松林有专门聊过线性注意力的模型。大家想去了解一些背景的话,也可以去听之前的节目。
49:24 3
我觉得 K 三这次直接在这么大的规模上用了线性注意力,应该来说还是一个比较大的或者说比较激进的改进。它的好处是效率的提升是很明显的。但一般来说,大家会认为线性注意力它会在效果和性能上有一些损失。志远你可以来讲讲 K3 它这次用的这个 KDA 是一个什么样的改进,给业界的启发是什么?它是怎么去平衡?可能以前大家会认为的就是你使用线性注意力的一些弊端。
49:53 1
对我个人觉得这是一个比较大的进展。就 K 站的路线,就像刚刚说的那样,它是让大部分层去使用一个更高效的 media attention,也就是 KDA。然后同时去周期的保留这种给体的 MLA GTI MLA 它用来提供给所有历史 token 的这么一种直接的全局的 attention。最后相当于把接近 4 分之 3 的这种 tension leader 都换成了 KDA,也就是一种 media tension 的实现。而且最后做出了一个非常双 til level 的这么一个模型。
50:25 1
就这套混合架构本身之前其实 KMD 的也已经验过了。但当时它其实模型总参数大概只有 48B50B 这种级别。K3 就相当于直接把它放大到了接近 3T 也就是说这总参数规模接近放大了 60 倍,这其实是一个非常大的一个进展。其实比如说之前的快 3.5,它是一个大概 40B 的模型。它其实同样也采用了三层 git the at net,再配一层给 IT attention 的这样的一种在比例的设计。
50:55 1
那 K3 它其实进一步把这种以一定的参数为主,周期性的去保留 global attention 的这种 hybrid 的这种 attention 架构。它直接给 skid 到了接近 3000 的这么一种相当大的一个级别。在这里其实值得一提的是,像 deep seek v4 它其实走的是另一条路线,它没有去使用 media 参数,而是仍然在 service max tension。
51:18 1
就正常的 tension 的框架里面通过 KV compression 以及 SPA attention 这样的一个 hybrid 来提升上下文的效率,这是不太一样的一个路线。所以我觉得这次 K3 带给我以及包括很多人的启发,可能就是我们其实并不需要把富 tension 和钉钉 attention 去理解成一个二选一的这么一个关系。有 hybrid archie 确实是一个很有前景的方向。简单来说就是你可以不同的 attention 它承担不同功能。就比如说大部分层我们追求效率,少部分层我们去保留一个高容量的这么一种全局的 attention,保留这种 global interaction。其实 K 加的这场已经有效证明了这套方案它是完全可以 scare 到接近 3T 的这样一个非常 slan til 的这么一种 scared 的。
52:06 3
我想补充问一下,它现在 3 比 1 的这个混合比例,三层线性注意力混一个全局注意力是怎么决定的?就去年我和松林聊这个线性注意力的时候,因为其实实际上大家用的线性注意力一般都是要混全局注意力的。他当时跟我说这个怎么混,主要是靠经验,是实验出来的那现在有了更多的理论方法或者说总结出来的规律来指导怎么去混合。
52:31 1
从公开的资料来看,这个比例的决定本质上应该还是靠 empirica,就是去靠做实验。之前 KMLA 他们专门在一个 16 层的一个小模型上,就是上面提到的这个 48B 的一个模型上,它比较了不同的配比。他们当时的一个结论是 3 比 1。它的在这个测试集或者说在这个叫做验证集上面,它这个效果是最好的,就是那个 popularity 指标它是最好的。1 比 1 的时候基本一样,但是复合态是更多,推理成本也就越高。所以 K3 基本上就沿用了 3 比 1 的这个比例。然后最后再去额外的加一层给它的 MLA,保证我们整个模型的结构最后一层一定是一个 global 的 attention。
53:16 3
你说一比一是一样的,就是说效果是一样好的。
53:19 1
对,效果更近。但是因为负碳性更多,所以相当于它就效率就更低。所以像 K3 reports 他们其实也没有说他们在接近三期的规模上就重新去扫描过各种比例。毕竟你可以想象这肯定非常贵。
53:34 1
一般来说的话,在模型训练的团队里面,就是这种特别昂贵的 ablation study。尤其是这种 catch ablation study,都会先在小模型上做,然后再去沿着 skin law 去验证整套的像 architecture,包括这种 recipe,能不能稳定的放大 K3 它确实去也做了一些整体的 c log 的 study。但是它主要验证的还是整套 K3 的这么一个 recipe,而不是说我们把每个细节都拿出来。所以 3 比 1 到了 3T 它不一定说一定百分之百就是最优解。但是它目前作为整体设计的一部分,它其实我们看结果它已经很成功的 skill 上去。
54:12 3
接下来的一个问题就是说它因为 K 三是一个百万上下文的模型,其实上下文非常长。他在这么长的上下文里面,他是怎么去解决以前线性注意力可能会有的这种遗忘的问题。
54:26 1
这也是一个非常好的问题。我们先要把遗忘这一点说的更准确一点,inattention 它的设计上,其实一般来说大家会认为是一个 trade offs。它会把任意长的历史去压进一个固定大小的 record state。就比如说在 K3 里面,对于 KDN 成员来说,这里好处就是说 cache 和每一步的计算,它不会随着上下文去一直增长。代价就是说我们不同的信息会在有限的这些状态里面就会互相干扰,就会导致什么?特别早,尤其是那些特别细节的信息可能会被覆盖掉。所以问题的根源其实在于这里的这个 compression,它因为是一种固定 state 的,它本身就会存在容量的瓶颈。
55:12 1
当然了其实 KDA 他作为一个 media attention 的这么一个 warrant,他在用他用的其实一些 technic,他把这件事情他做的更聪明了。就比如说他们用的像 dt,像 china wise forget gate 这样的技术。就简单来说,他每次可能先看 memory 已经预测出了什么,然后我们只去写他在预测的时候的那个偏差。然后同时不同的 channel 可以学到不同的保留时间。除此之外,比如说 K3 他们还给每一部的 retention factor 去加了一个 logo 棒。这个其实在 tech report 的飞鸽三那里有一些分析,感兴趣朋友可以自己看看。
55:48 1
就简单来说,他直觉上也可以去限制过于激进的顺势遗忘。但我觉得其实上面说了这么多,就是 KDA 他特别聪明的一些设计,其实我觉得他更多还是更好的去管理这种有限的 library 的一些手段。它并不会说从根本上就消除上面说的这种容量瓶颈的问题。说白了就是你你在计算的时候,多步累积之下信息还是会衰减。所以我个人感觉 K3 它解决这样的一个百万上下文级别的遗忘问题的时候,真正答案还是因为做了这个 hybrid 的结构。
56:23 1
就像我们前面说的那样,我们每三层的 KDA 会加入一层给 T 的 MLA,最后一层也一定是一个 MLA。MLA 它是这种 global attention,它会保留对所有历史 token 的这种 global 的 interaction。所以模型它其实并不需要我们 KDA 就把这 100 万上百万级别的 token,它每个细节都压在它的这个 record state 里面。就上面说的其实也很困难,但是因为有这个 MLA,那 MLA 提供了这种 global 的 interaction,就是这种全局的这种 attention 的这么一种机制。所以我觉得他应该是一个缓解遗忘非常关键的一点。
56:57 3
其实像比较早的时候 mini max m1 很早了,25 年年初的时候他们也做了这种混合的方式。后来他们又换回了 full attention,就思路是一样的,然后效果不一样。
57:08 1
我个人觉得很多时候他的做很多事情的霸主还在这个 exception。就是在这个执行上有东西能做 work 不能做 work 不代表这个技术路线本身 make sense 还是不 make sense。他可能说具体实现的时候,比如数据不一样,英法不一样,然后做这个事情他有很多小的细节不一样,他最后可能就都很不一样。
57:28 3
注意力结构的变化,它也会带来一些 inter 上的变化。陈阳正好可以 call back。像我们上次在讨论 V4 的时候,也讨论了吸收注意力和线性注意力这两种改进方式。你当时提到说你觉得线性注意力的理论优势可能要再等几代真实的大模型的验证。那可以说 K3 现在它其实已经验证了线性注意力的一些理论优势。包括这种新的距离结构,它会给英特尔带来的一些影响和变化是什么样?
57:54 2
我觉得我之前的判断还是很有道理的,我可以诚实的更新一下我的判断。然后也大家在听音之前,我们在晚点的 podcast 里面讨论 deep CV 四的那一期节目。我当时提到了两件事情,第一个就是线性主义的理论优势是需要几代真实的大模型来做验证的。第二,稀疏路线在工程上面更可控,和现有的 QV cash、prefix cash 这些基础设施的兼容性更好。首先 K3 对于线性注意力这个路线的验证,实际上每次有新的大模型发布,我的朋友圈都会围绕着线性注意力还是集中注意力吵成一片。
58:30 3
其实我觉得非常的不错,好吧。
58:32 2
无论是做还是做算法都是这个感受。K3 的话毫无疑问是对线性注意力的一个有效证明,一个 2.8T 的主线模型,而且 media token 并且使用的 nope。然后 K3 的 MA 层完全不用加位置编码,位置信息就全靠 KDA 的地推门控还有衰减来提供。这样的话就是它扩展到百万的这个 medium token 的时候,不太需要重调类似于 rope 的这些频率,底座等等,也不太需要像家一样专门去做插值外推起来是非常自然流畅的,这个设计和效果当然是非常好的。
59:07 2
然后第二点,我说吸收注意力在工程上面会轻松一些,这个看法也没错。这段时间我们 S 浪团队也花了很大的精力去尝试把线性注意力需要的 recurrent state 也纳入到已有的 prefix cash 体系当中。就让 K3 这种 hybrid KDAMLE 模型的前缀复用,能够达到和全注意力模型一样的通用性。长期来看线性注意力和稀疏注意力的兼容性差这件事情可以逐渐被工程弥补。当然代价就是。我们的抽象会比以前更复杂一些,对吧?
59:40 2
另一个角度说,这个线性和稀疏也不是一个二分的问题。K3 选择一个 3 比 1 的混合,每个 block 3 层 KDA 加上一层的 gate MA,然后 overall 这个 backbone 最后还会有一种额外的 MLA。线性的部分是靠 KDA 来提供这种我们所谓的位置敏感的序列,然后全局的部分就是靠来提供这种不受限的内容交互,其实这个体现的模型也非常强大,所以我并没有说这个线性我细数哪一条会胜出。我更愿意相信的是任何一个能够在百万上下文这个水平上,把成本类似于我之前讲的这个 KV cash 的 transfer 成本,类似于我之前讲过这个 preview 的一次成本。但是我们之前可能也之前也讨论到一些这个 rapping 的成本。这些成本能够压下来的架构,它大概率都是异构的。然后异构的模型架构对于我们 S 阶段推理框架而言,需要持续性的同时维护好多种形态和生命周期的 attention 抽象架构。这是一个巨大的工程考验,这也是我们团队工程能力的体现。
01:00:45 3
我觉得挺好的。这事儿越难,就是说他的工程工作越多,其实你们做的工作越多,你们的价值会越多。
01:00:54 2
希望如此。
01:00:55 3
OKKDA 就是这种线性混全局的方式。它因为理论上就是你加了线性,其实你的效率会提升。这个也可以讲讲,比如说你们在做适配的时候,观察到它效率的有哪些提升,还是比较惊人的。其实她自己的技术报告里有写到,就是说它是有实现了在百万 token 上下文场景下的 6.3 倍.
01:01:17 2
的解码加速。6.3 倍这个值其实不是 kimi k3 报告里面的严谨值,而是 kimi 更早的 kimi var 论文里面的数据。不严谨来说,在同样的模型规模下,线性注意力为主的混合架构比起传统的全注意力架构在 100 万 token 这个全上下文量级混合架构生成的 token 速度是全注意力架构的 6.3 倍。6.3 倍是一个非常可观乃至令人惊讶的数字。
01:01:46 2
我可以简单解释一下模型的 decode 阶段,每吐一个 token 都必须要把整个请求的全部历史上下文读一遍。全注意力架构的历史是整个 KV cash,它是跟着上下文长度线性变长的,100 万 token 的 KV cache 的长度近乎是一万个 token 的 100 倍。上下文越长越靠后的 token,它的这个开销是越大的。然后线性注意力则试图把请求的历史信息压缩到一个固定的 recurrent state 当中。100 万 token 和 1000 token,他们的线性注意力的 recurrent state 几乎是一样大的。
01:02:21 2
我也分享一些我们 S 激荡团队为 K3 设计的推理站的实际数字,来为大家提供直观体验。这个 kinney 是 69 层的 KDA 加上这个后面应该是 24 层的 MALA,那么 69 层的 KDA 给一个请求分配的历史信息大小基本就固定在 54 兆,所以 54MB 不论长短。然后这 24 层的 MLA 是全局的注意力,然后他会为每一个 token 额外的分配 27KKB。一个百万上下文长度的请求在 MIA 上的开销大概就是 27GB。听上去是一个 54MB 加上 27GB 的组合,但是如果先前的 69 层也是全注意力,那就不是 54MB 了,而是额外的几 10GBKDA 和 MIA 的组合。节省下来的存储大小进一步反映到 KV cash 的搬运成本上。然后某种程度上让整个推理速度快了 6.3 倍。
01:03:19 2
然后最后一个问题就是什么情况下这个 6.3 倍的底线是最明显的?毫无疑问是长的 agented coding。如果每一个 agenticity coding 请求都消耗上百 GB 的 KV cache 的话,最强大的 HBM 缓存也撑不住几十个请求。
01:03:34 3
就除了 KDA 这个新的注意力机制之外,这次 K3 的另一个新的东西是 attention residue,这也是之前他们发的成果,是今年春天的时候发的。然后当时马斯克还转发过,我觉得他用到 K3 上的速度是非常快的。这个我也可以补充一个,就是我了解到的信息,其实在做 tension reduce 的时候,差不多就是 K3 在定版版的同期。所以其实当是要不要直接把这个东西放到 K3 上,还是说我再放到下一代的模型上,其实他们内部是有一些讨论的。后来杨振宁也是拍板做了这个决策,就直接放到 K3 上了,他是很快就进到一个主线模型上的一个成果。正好我们上次讨论 V4 的 MHC 的时候,也是讨论到了 kimi 的这个 attention reduce 是有一些异曲同工的作用,就是想追求的效果是一致的。想先请致远和大家简单的介绍一下,就是 attention reduce 是一个什么东西,它的作用是什么?它是在模型里的,就比如说哪一个模块或者哪一层发挥作用。
01:04:35 1
我觉得 tension reduce 它解决的主要是模型它在这种深度,就从浅到深方向的这么一个信息流。最早的时候最标准的这种 religious connection,它在展开以后,当前 layer 他看到的他本质上是 embedding,以及之前他所有比较浅的 layer 的 output 的直接相加。而且这里每一项的权重,它本质上就相当于一个固定为一,直接加起来。其实你随着模型能越来越深,这种 regular stream 的它的大小它就会不断的增长。其实导致一个什么问题呢?就是你每次新加一个 layer,你新写进去的这个信息,它其实就会被逐渐的给稀释掉了。而且同时你对于后面那页,就更深的那页来看,他没有一个直接的机制去说 OK。那我现在我要去选择,我现在更需要前面的哪一层,或者说哪些哪些层的这种 representation。
01:05:25 1
其实 attention reduce 的这个 ID 它非常直观,就是我们把我们正常的 attention 去旋转一个 90 度,就比如说简单来说正常的 tension。你是在 token 之间去算那个匹配的分数,然后去做选择。那其实他就是在 layer 之间做选择。
01:05:40 3
层之间对对对。
01:05:41 1
就是会在层之间做选择。它每层各自会有一个可以学习的一个 super query,这个 query 在所有 token 之间都会共享,这时候它会和当前 token 在不同深度的 reported 做一个匹配,然后再通过像 soft max 这样去决定应该从哪些更浅更靠前的这些层里面去读取信息。当然这里虽然 query 本身它是固定的参数的,但是不同偷窥在各层的 representation 它是不一样的。所以最后,它的这个 tension 的权重,它还是会随着 token 内容变化而变化。所以这主要就是 tension reduce 的一个原理。
01:06:17 3
之前其实 V 四的那期我聊到过,就是 MHC 和 attention reduce 它其实想追求的效果是相似的,就是你最开始前面也提到了,K3 的整体思路也是把信息在不同方向的流动都做得更有效率。Attention reduce 解决的就是你刚说的层之间的这个信息的流动。回到这两种方法上,巨猿你觉得它有哪个潜力更高的这种区别吗?
01:06:40 1
这个问题就他们这两种方法,他们肯定还是想解决同一个大的问题。上面也提到了你标准的这个 religious connection,它在深度方向的信息流它是太单一了。当然这两种方法他们解决的思路就非常不一样。
01:06:54 1
这里我可以大概说一下,就非常宏观的很直接的一个 idea。MSC 的做法它大概就是我们会维护多条之前就一条并行的这种 radio street。那每一层我们会先动态的把这些 stream 混合成这一层的输入,然后再把这一层的输出分发回不同的 string。同时它这里还有一些实现上,它这些设计上的一些细节。就比如说他们会对 regio mixing 加上一些约束,然后去保证信息 greedier 这样的东西它在模型变身以后不会被无限制的放大。然后像 channel ads,其实就像我们刚刚说的那样,它更像是什么呢?就是你可以说更像是每一层我们去提供了一个历史目录的信息。然后这样的话他可以去直接去找前面某个阶段产生的信息,然后选择性的把调回来使用。
01:07:41 1
我个人感觉如果你只去讨论这个架构的这种表达能力的话,只去看那个理论上的上限的话,那可能你说产生 duce 的上限更高,这个是 make sense 的。毕竟你想 MSC 的刚刚说的这种原理,它最终说白还是把所有的历史信息它都递归的去压缩在一个固定数量的这种 radio streams 里面。那 for tension 的这种 reduce,它其实就有一点点像在每个 token 上,我们对于所有的比我们更浅层的那些层,它的输出形成了一个深度方向的这种下三角的这种注意力的这么一种 map 1 种 attention map。所以其实我做一个很不恰当的比喻,但是形象的说他就有点像我们在层的这种深度方向上,一个是 recurrent model,一个是 south max attention。MHC 就它的信息要通过大小的 state 一层层传递,有点像这个 need attention 对吧?那 for attention reduce,它就可以直接去跨层的读取。从表达理解角度,肯定是 for attention 这个还会更高一点。
01:08:47 3
你刚那个比喻意思就是说它在层的角度,一个是 RNN 对吧?一个是个 transformer。
01:08:53 1
对对对,就是或者 media attention,它其实也是 RN 的变体。但如果我们想讨论最终。实际效果的话,我觉得还是要看大家具体的 SQ tion 的细节。就比如说像 K3,它其实用的也不是刚刚说那种完全 global,所有层之间都能互相有弹性的结构。它做的其实是一种叫做 block attention readers 的这种 technique。它不是理论上表达的那些最完整的那种 for attention reduce。就比如说它会先把层分成很多 block 然后他会先把每一个 block 里面的层的输出给汇总,然后在 block 和 block 之间做。
01:09:26 3
attention。我想到这个有点就像。
01:09:29 1
吸收注意力了。对。然后再比如说 tex reduce,它其实需要保留更多的历史的 application,这里也会带来一些像 infer,像 memory 和 communication 的这种成本。然后 MSC 其实也有一些自己 infer 上的问题,所以我觉得最终的效果肯定要看车身的细节。当然了我觉得目前你可以确定的是 K3 和 V4,它已经分别证明了这两种路线其实都可以去 get 到非常 frontier 的一种级别。所以未来到底哪一种路线会更有潜力,或者说它能做到一个更好的效果,我觉得其实还是很拭目以待的。
01:10:03 3
对我觉得前面因为讨论很多东西,它是对比着来看的,包括前面说线性和稀疏注意力这些。你能看到有一个趋势好像是条条大路通罗马,对吧?大家反正会有不同的实现方式,但大家看到的问题是相似的,就说行业里大家看到的瓶颈或者要解决的东西是相似的。
01:10:24 3
下一个话题是优化器,和 V41 样,就是这次 K3 里用的也是 mi 的优化器。而且米网这个优化器之所以它能被比较规模化的使用,其实本身也是 kimi 自己更早的时候他的一个成果 muon clip。然后他也把这个成果贡献给了业界,基本上是现在比较主流的一个优化器的方法。然后这次在 K3 里面他们自己又有更进一步的改进,是提出了 per head 的。然后这个想请致远可以再帮大家讲一讲,一个是说优化器为什么比较重要,它核心解决模型的什么问题。另一个就是 K3 这次里使用的这个妙的优化器 per head mal 优化器,相比于之前 K2 已经在用的缪网,它的一些具体的改进是什么?
01:11:07 1
其实优化器它是相当于模型训练,不止语言模型训练,就深度学习模型训练里面它非常重要的一个组件。还是解决的核心问题。说白了就是我们现在有个模型,然后每在训练过程中我们的 batch 算出一个梯度之后,我们怎么把这些梯度转换成一次非常稳定而且有效的参数更新。而且是从长远来看比较好的一个参数更新。
01:11:31 1
那就比如说我们在训练一个模型的时候,我们会涉及到 function。但是其实说白了就是我们要优化的东西。然后梯度的就告诉你局部大概要往哪里走,那其实优化器它就会决定最终要采用什么方向,走多大一步。然后我们怎么去利用一些历史的梯度去降低噪声,去处理不同方向的尺度差异,去处理不同方向的各种冲突等等的这些信息。那其实一个好的一个优化器,它通常意味着在相同的时训练的这个集采量下,我们可以收敛的更快,最终的 loss 更低。
01:12:03 1
而且还有一个很重要的就是稳定性。就是我们不希望我们在训练过程中出现太多不稳定的这种 Spike。它本身的核心是说我们在拿 item 就是动量。它是一些优化器里面根据梯度和历史梯度串出来一些信息。我们拿它去更新参数之前,我们先把它做一个近似的一个正交化。这样的好处就是我们让更新不要去只集中在少数几个比较 double inter 的方向上。
01:12:32 1
问题是就是正常的这个谬就是你考虑以前我们的多头的 attention。它在存储上虽然是一个大的读音矩阵,但是其实在整个算法的计算逻辑上,就是对于模型架构来说,每个 head 它是比较独立的这意味着如果你现在把所有的态度都放在一起正交化的话,那其实他们的这个 audient,包括 omens 的这个动量的这些就是梯度和动量的这些信息,他们就三号会有一些冲突。就比如说有的 skill 更大的这个 head 的,他可能就会主导整个真的更新方向。企业比较小的注意力头,他们可能就没有办法去被充分的 novation。所以 perside 别忘了这个核心思想,就是我们对于每一个注意力头,我们都去单独的做一次 Normalization。就意味着我们不同的这个 head,不同的注意力头,他们在做更新的时候,他们的大小,他们的 skill 就更加均衡了。所以其实 K3 response 里面也专门提了,就是说他们发现这个 probe want 在他们的 set up 下,可以让这种训练的这种彻底 dynamics 更加的平衡,能够很好的去改善大规模训练的稳定性。
01:13:34 3
相比 moon clip 就是 kim 自己之前提的改进,它新的这个 per head moon 它实现起来的难度会更大。我想知道它有可能在业界怎么扩散,因为喵 clip 其实在业界还是有挺多扩散的,很多别的团队也会用。
01:13:49 1
我觉得从实现难度角度说的话,像 per head 这种愿望,它其实算法上基本上就是我们直接去做成很多的注意力头这个 block 然后做一些并行处理,所以算法本身还是挺直接的。我觉得实现的难点一个难点可能是我们在大规模的训练里面,像这个 QKV,他经常被融合以及切分。其实这就导致了这个优化器的 state,它会分散在不同的 GPU 的上。所以我们必须要保证每个注意力头它在算法计算上的逻辑边界它不会被打散。同时我们又能够非常高效的重建这个完整的 block 然后还要把大量的这种小矩阵去合并执行,再去一起在一起做一些计算,避免带来非常大的这种通信拆箱,然后避免一些克隆浪车上的问题。所以我觉得像 K3 他也在 time report 里面提到说他们为 bill 也做了一些专门的处理。比如说他们把通信和正交化计算去做了一些排。
01:14:46 3
关于优化器我还有一个小问题,就是构造新的优化器改进这件事 AI 可不可以自己来做。因为上次我们有聊到愿望,最开始是一个个人开发者 kerry Jordan 他提出来的,后来我了解到是其实是在 Jordan 搞的一个开源项目,叫 nano GPT speed run 这个里面诞生的。然后这个项目简单来说就是我让所有人去训一个比较小的模型,一个标准任务。然后大家来比速度,谁能最短时间做完。
01:15:15 3
最近有一个新的公司 RSIA,就是 team 师,还有田园栋他们的一个新公司。六月的时候做了一次尝试,他们是用系统来自动化的跑这个 speed run。之前其实两年多的时间里面,speed run 都是社区里的一些研究者,就是人来做的。所以有一个小的脑洞是说,优化器是不是未来 AI 自己也可以来写,然后来制造了。这确实我。
01:15:37 1
觉得是一个非常重要的一个未来的方向。而且事实上我觉得其实社区里面已经有一些早期的城市了,我觉得主要是就做这种优化器的研究。它就天然非常适合这种 auto research。因为它的这个 pipeline 整体来说还是相对说比较结构化的。我们会比如说先提出一个新的优化器的方案,然后我们去写代码跑实验,然后我们去看这个 loss,然后看比如说像稳定性,看这种曲线,这种俗称做 VBC,然后再根据这个结果做一些改进。所以这里你会发现研究的目标还是比较明确的,对吧?而且最后的指标其实也非常清晰。所以其实在满足这两个性质的问题,其实就很自然越来越多的就会被交给 AIA 来做了。
01:16:23 3
这也呼应到了我们前面讨论的,就是他用一些早期的 chat point 的版本来做 pro 的开发。这次 K3 刚才陈阳也说,他觉得一个是你目标比较明确,然后第二点是你的结果其实比较好验证。第三点是不太容易被 hack,就作弊的空间比较小像这种都是挺适合 AI 自己来跑的。
01:16:44 1
对我觉得是这样的。然后我个人觉得这里其实还有一个很有价值的问题,就是我们可以让 agent 去研究怎么去设计一个小规模的 setting,然后让这个 setting 里面能够得到结论。它它是能更好的去 generalize 到真正的那种大我训练的说白了就是你的一个优化器。它在小模型小规模的时间上跑得好。那不代表说我们换到一个更大的模型,然后更长的一个训练周期,甚至包括不同的参数形状后仍然好。所以我觉得就是 AIG 我们不仅可以让 AIG 去研究我们下一个非常好用的这个优化器是什么。还可以研究就是说我们应该去用什么样的小规模的这种 proxy experiment,什么样的 scanning letter。它是能够最快的判断一个优化器能不能最终 scare 到我们目标的这个场景下的。
01:17:31 1
如果这个问题我们能够做的非常好的话,其实我们就可以大大加速整个对优化器研究的一个迭代过程。因为毕竟你跑次实验还是要花不少时间,不少资源的。如果你能够用最少的资源去飞速的做一次验证,然后这个验证的结果也很可靠,整体的流程其实就会被加速起来。
01:17:50 3
所以一个是优化器本身的改进,AI 可以自己来做。另一个就是你刚刚说的,我预测不同的改进哪些更容易规模化。这件事儿也。不可能自己来做。
01:18:01 1
对对对,或者说你怎么去设计一个比较小规模的场景,然后使得这个小规模场景下出来的结果是比较 make sense。Make sense 就意味着它在大的这个 skill 下仍然是对的,或者说比较 transferable.
01:18:13 3
的对那这个方法其实也不止可以用在优化器的改进,因为你基本上 AI 训练你的很多部件都是你先在一个小楼上面试,然后你得给他 skill 对吧?
01:18:23 1
对对对,包括我们前面提到的各种模型架构的改进,然后包括各种不同强化学习算法它的调整,这些我觉得都是个很关键的问题。就怎么在小规模的实验下,能够让大规模的实验结果也能更加 predictable.
01:18:37 3
这个是模型开发很核心的一个能力,而且你做的好的话可以节省很多资源。我想了解一下,据你所知,业界有谁能初步掌握了这种能力吗?
01:18:46 1
我觉得这个不是业界有谁初步掌握这个能力,就是大家都有这样的能力,只是有的做的更好,有的在有的领域做得更好,有的在有的领域做得更弱一些。
01:18:55 3
谁在这个方面做的比较强我觉得。
01:18:57 1
还是 frontier lab 更强。就是美国的 open pic 他们这方面做的应该是非常好的。他们一个自己资源又多,一个是他们这一套怎么去做小规模的这种验证的各种流程,各种基建也更成熟。
01:19:11 3
之前一直有一种观点,就有的人会认为像美国的这种 frontier lab,因为它的算力资源会多很多,其实比中国的一些公司多 1 到 2 个数量级。所以可能他们反而很多这种比较细的改进,对他们来说就不一定那么必要。我就是指就是比如说你刚刚说的,我能更高效率的使用算力这件事儿,然后反而是中国因为大家很缺算力,所以可能你前面做实验的过程也会非常谨慎。然后也会找各种各样的方法说我怎么在有限的算力之下,我能达到更好的效果。你觉得这种观察成立吗?
01:19:45 1
我觉得这个说法一方面是有道理的,就比如说你可以看到 deep seek 里面有很多的这种工程上的优化,确实是压到了极致。但另一方面其实我觉得也不要小瞧 from till live 他们做各种优化的能力,他们其实也是很有东西的对,不管是各种小优还是各种怎么在小规模做的好,然后去尖锐到大规模的。
01:20:04 3
有一个就是对 SRP 的观察,想和你讨论一下。就比如说你周围交流会不会有这种感受,就有的人会说 SR pic 其实在比如说架构这一层,他做的花活没有那么多,他是把很多重点都放在数据,然后放在 infer 上。
01:20:21 1
对我觉得根据各种 gossip 确实是这样,他们基本就是相信 doing the basic things right,就是怎么把一些简单的事情做到其实的正确,然后就去有效 skating,能把事情做 work。
01:20:34 3
我们来讨论就是后训练的这一部分,后训练和 RL 虽然前面有聊到说他后训练的细节并没有披露这么多。然后这次可以在技术报告里看到的是 kimi 有一个有意思的设计,是他先训练九个领域的专家模型,然后他通过 MOPD 就是 multi teacher on policy destination 给它合并成一个模型。这个也许应该能翻译成多教师的在线蒸馏。对,给它合并成一个模型。可以请志远分享一下,为什么它不直接联合训练一个要先分后合。对。
01:21:05 1
其实这个 MOPT 这个 both t 恤 policy dissolution 这个 recipe,它其实最近一年它已经快速成为了一条非常常见的一个 post trading recipe。
01:21:15 3
像这种方法其实一般大家也不会说专门写个文章去讲。
01:21:19 1
对吧?是的,尤其这种 MOP 这种。
01:21:21 3
它不太去研究问题。为什么?像比如说 attention reduce 这种东西,kimi 就会专门写个文章。然后像 MOPD 这种,就可能没有任何公司会专门写文章去讨论这个话题。
01:21:31 1
我觉得这个问题其实问的非常好。我觉得你的一个东西能不能写成文章,一个很重要的问题是你能不能把它水母成一个非常比较 clean 的一个 research 问题,一个研究问题。比如说像 tech religious,它可以有一个很 clean 的研究问题,它指标很明确,你要对比的对象非常明确。然后比如说像 MOPD 这种,你不做 MOPD 的话,你要对比的那个其他的方案就特别麻烦。MOPD 它可能更像是我们直接避免了一条很麻烦的路径。然后你就不需要关心说我们怎么把这个麻烦路径调的非常明白。所以这里就它相对来说就不是那么干净的一个研究问题的一个 setup。
01:22:08 3
我在想他的这个相关的一些影响,比如说你看 attention rest ce 它写成一篇文章,它有三个一作对吧?对这些作者来说,他肯定是有他的职业的。Credit 的增加的那业界也有很多,就是大家用了很多的方法,好像也不知道最开始是谁想出来的。
01:22:26 1
其实在比如说在美国这边,其实 file name 之间有个人提出一个很好的想法,就类似于他的小圈子内部其实是都知道是谁提的,所以其实不会影响他们自己的。比如说 credit,包括更直白一点,他们的身价这种就是这种消息流传起来都很快的,只是他不会在公开的网上流传 OK。
01:22:43 3
所以它是有点像圈子内都知道,但是外面的人不太知道。
01:22:47 1
对对对。
01:22:48 3
那那你可以继续来说,你就说这个东西最近这半年到一年,它其实变得很主流了。
01:22:54 1
对对对,他最近一年已经快速成为了一条非常常见的一个 post change rec p。其实公开采用这条路线的就已经包括像 b mo 的 V2,像 deep seek 的 V4,以及包括后面 radia 做的 number tron 3 ultra 就是这些模型。
01:23:09 1
然后包括这次的 K3,这里用 MOPD1 个很重要的原因就是我们想把不同领域的研发过程去解耦,方便我们一个很大的一个模型团队下面有各个小团队他们之间的合作,就比如说像 generation,像 code agent,像 general agent 这些等等。他们不只是 data 不一样,他们其实包括像 environment,像我们去给奖励的策略,像我们做一次 root 的程度,像他们使用的 honest,甚至是算法的这个 recipe,它都可能非常不一样,对吧?那比如说像 code agent 里面,包括 infer 可能也会有一些区别。比如说一些 code age 里面的 input,它可能会有一些自己的挑战之类的。所以其实如果你全部都放进一次 join 的那种 RL 就把你的所有东西全部混到一起,然后做一些大的 RL rn 的话。那其实我们在混这些动漫,混这些不同领域,然后混接不同 reward。还有包括前面说的各种训练的设置,它就会全部给耦合到一起,就会导致你做模型合板的时候,你的这个技术压力非常大。就是你要把这些东西,他们可能本来自己的 team 里面他已经做 work,然后最后你盒饭的时候还要考虑说怎么合起来再 work。
01:24:18 1
然后他们各种赛道步罗非常不一样,对吧?就是这样会导致压力特别大。所以如果我们用 MOPD 这个 SST 的话,我们就可以先分别训练各个领域的专家模型。其实每个小团队他们最后要 deliver 给合板的我的这个成果,它其实就是自己领域的这个小的专家模型。而不用把上面说的那些乱七八糟的什么各种有 recipe,各种 info,还有包括各种什么 environment 这样的东西全部都给 deliver 出去。其实每个小团队我们就专注的把自己的领域的模型给训练最好。然后最后合板的时候我们再用 MOPD。
01:24:51 1
这样的话大家就比如说你不需要为了方便最后的一个交易 training,我们提前把所有的 recipe 和 info 都强行统一,对吧?那就可能会导致你在做自己领域的时候非常的束手束脚。然后我们也不需要说我们在每次迭代的时候去同时协调所有的领域,这样就能让你的迭代变得非常快。还有就包括你做合板的时候,我们不需要花特别大的力气去协调各个方面。
01:25:14 3
所以以前他也是分开训练的,现在也是分开的,只是合的方式不太一样。以前是一个更完整的合,就是你得带着各种训练设置一起来和。现在是每个专家训完之后,我最后只和那个结果,对吧?
01:25:28 1
以前就这样的,RL 春定就还没有那么麻烦,对吧?比如说最早的时候我们不需要做 A 键的 L 那也不需要 infer。可能比如说相对来说也比较统一,大家只需要把数据贡献出来,然后直接一合就可以了。但现在就是各种,然后方便他们的 recipe,不同领域就会复杂很多。他们都有自己的这个 recipe,所以我们纸盒模型的话就会方便很多。
01:25:52 3
他在直觉上,他好像给人一种跟预训练的趋势有些相反的这种特点。因为预训练其实你是在同一个模式里,你是吃了不同就非常多元的数据,对吧?你就是放在一个过程里去训的。对对对,然后后续按你刚才的描述,其实是之前后训练他要处理的任务,下游任务比较单一或者简单的时候,大家其实是在一起训的。
01:26:13 3
对对对,那现在就是你能看到它是一个好像在走向分的过程。比如 K 三这次有九个分开。对他为什么是这样的一个过程?以及你觉得他更远来说,他有必要又就后训练这个阶段,他有必要又变成一个合的过程吗?那样的话他会潜力更高吗?
01:26:28 1
我觉得是合起来还是 OPD 哪个潜力更高?这个还真不好说。就是有很多的研究他们会说可能做 MOPD 他比去直接做的这种 joint 的要效果要更好之类的。但是我觉得这种结果,你都要看它非常具体的实验的 setup,才能说他的这个结果到底有多 generalize。我觉得目前做 MOPD 主要还是说白了就是这样是最方便。就是你不用像我刚刚说的那样,你每个团队有一个自己的方案之后,你还要去和方案。而我们是和最后的这个叫做模型就行,就相当于说白了就是你和 resting 很麻烦,但是和模型就用 MOPD 就很简单,然后大家就专心的把自己。
01:27:10 3
模型做好就行。然后 MOPD 里其实它的英文,它最后一个是 D 是代表 destination,就是蒸馏,翻译过来就是蒸馏。我觉得正好也可以说一下,就本来蒸馏的意思是什么,以及业界因为现在关于蒸馏有很多讨论,那实际上他从技术上来说是怎么一回事?
01:27:27 1
对,就这理由。从技术的最原始定义来上来说,它 always 都是去把汽车模型,就教师模型的能力他去传递给一个学生模型。它最经典的用法其实就是去压缩模型。就比如说你先训练一个很大的一个教师模型,然后我们再把能力去蒸馏到一个更小的一个学生模型。这样你可能就用学生模型,它更便宜一些,对吧?就比如说他 Q3 里面,它它的这个技术报告里面就说了,我们会做这种 strong to week desolation。就是先去获得一个强大的模型,然后再用他们去帮助虚拟小小模型。所以从技术的角度,它 always 都是教师模型去传递给学生模型能力。
01:28:10 1
但是我们更多要看它的目的是什么,就比如说在 MPD 这里的目的,它不是说去压缩模型,而是我们刚刚说的合板。就是我们先从同一个 foundation 的模型出发,我们训练出不同动漫以及不同 reasoning effort 的教师模型。最后我们再把它他们的能力去传回一个统一的一个学生模型里面,这是目的一方面。
01:28:33 1
另一方面就是我们这个蒸馏具体怎么实现。从具体的算法角度,就是 on policy isolation 做的事情是我们会让这个学生模型自己去生成一个轨迹。然后学生然后教师模型再对这个轨迹去打分,提供一种比较稠密的叫做奖励信号,然后用这个奖励信号的来去提升学生。
01:28:55 1
然后另外一种也很常见,或者说更传统一点的蒸馏模式。也就是刚刚麦琪提到的,就是说在这种普通大众在社交媒体上去讨论这个蒸馏,指的就是一般是说我们这个老师先去预先生成一批固定的答案。然后学生呢就直接在固定的数据上,这个离线的数据上,我们直接去模仿学习,去学习老师的模型。他在这个输入下它的输出是什么?
01:29:19 3
这里 MOPD 使用的 on policy 的蒸馏和你说的就是我们平时讨论的语境里面更常提到的那种蒸馏,它是 off policy 的蒸馏。这个 on policy 和 off policy 的区别是什么?
01:29:33 1
更多指的还是算法层面的区别。对对对,就比如说 a plus 它学生是被训练的模型,训练过程中学生自己去亲自去生成这个轨迹。所以我们说它是 of policy 的。Of policy 指的是相对于学生来说,老师他的这个轨迹它是一个 off policy 的。就是老师的轨迹不是学生自己生成的。
01:29:52 3
哪一种他的学习的效率会更高。
01:29:54 1
这个其实也是不同场景下有不同的经验性的结果。比如说要做合板的时候,确实肯定是 on policy description 这种做法,那还是 on policy 的比 of policy 更好。对。但如果只有这个教师模型的叫做输出,你没法搞到它的权重,logic 这些的话。其实你没法做到像教师模型去给学生模型细致的打分,那你就只能去做那种 of post desolation,相当于教师模型只能拿到它的这个最终输出。
01:30:24 3
假如说比如说 anthropic 他自己有自己的模型权重,对吧?比如他自己睁自己的话,从技术的效果上来说,你觉得它大概率它是 on policy 还是 of policy.
01:30:34 1
你说这自己生自己的目的是啥?
01:30:37 3
是为了变成一个更强的模型,就大家说的左脚踩右脚,然后自己原地飞升的这种这个。
01:30:43 1
感觉目前还是大家愿景,就是还没有真正做到。我个人理解主要还是看一种这种外在的这种监督信号它有没有。我觉得你很难再没有一个很准确的很能 scalable 的这种外在监督信号情况下去提升一个模型。也就可能就是说你最后用的这个技术里面,它的名字可能带了个 desolation,但他肯定是找到了一种很 scalable 的方式,能够稳定的把外在的这种监督信号给打进来这个过程。
01:31:08 3
最后在英特尔的层面,想请陈阳来分享一下,你觉得 K3 做英特尔改进的一些整体的思路是什么?因为你们这次 K3 也是第一时间做了适配,你可以讲讲你们适配的时候有什么有意思的发现吗?
01:31:20 2
具体来说的话,我可以分享一下 KDA 架构对于投机采样带来的挑战。投资采样简单来说,我们会通过一个小的模型来快速猜测出一批 token,然后让真正采样的大模型来一口气验证这些 token 是否正确。验证完成后,这批被猜测出的 token 当中,可能只有前几个 token 会被大模型接受。所以大模型在验证这批被猜测的 token 之前的状态是需要保留的。因为如果猜测不对的话,大模型要能够随时回退到猜测之前的那个状态,这对于普通的 attention 而言问题不大。就这样举个比方,你无非就是把书的后几页撕了,然后继续从笔记本的靠后的页开始写,对吧?
01:32:04 2
但是 KDA 的架构设计需要能够对每个 token 的递进状态进行原地的重写。为了能够回退到大模型验证之前的状态,我们必须要想办法对之前的递进状态进行存档。一个比较朴素的存档方法就是每走一步就把整个递进状态做一个快照。但是对于整个 69 层 KDA 做完整存档的保留的开销非常大。我们最后的做法是不存状态,只存每一步状态的极小投影,大概只有一个 KB 左右。要回去的时候就从上一个 check point 的出发,照着这些输入,把接受的那几个 token 的存档重放一遍。这很像我去看我小表弟他学习象棋的过程。象棋玩家为了复盘棋局,会通过一些简单的记号来记录每一步棋子的移动。
01:32:54 2
这样你就不用每一步都给整个棋盘来一次完整的快照。然后我们为了支持 KDA 的投机采样,其实也实现了类似的思路,记录棋子的移动而不记录整个棋盘。比较有趣的是我们后来观察到 kimi k3 的 take report 也和我们独立的提出了类似的设计。当然我们其实并没有提前为了这一块儿的设计做过任何讨论,也可以很荣幸的说,顶尖的工程团队,大家在这些工程问题上的解法都有。
01:33:22 3
异曲同工之妙。这次 K3 还开源了他们的一个 agent 的环境,它就是叫 agent in。你前面也说到,一般权重只是一次训练的产物,而环境是能够反复复用产生下一代权重的一个流水线,所以环境是更重要的护城河。也可以讲讲就这次从 agent in 里面看到的一些有意思的。
01:33:44 2
思路是什么?Agent 的 in 是一个最朴实无华的名字,我觉得还是比较有新意。因为一般而言,我们研究者往往为了模型的安全性,会去主动限制模型的能力。大多数情况下我们会通过更好的隔离方案来尽可能的锁死模型,让他少做一些越狱之类的操作。但是 K3 的训练团队选择通过更好的隔离方式来尽可能放宽模型的能力边界,就是模型可能受到的限制更小我相信他们自己也比较 believe 以后模型应该拿到系统权限是更高的。可能是这个样子的,往往我们认为 agent 越强的话,它的探索会越激进。
01:34:22 2
早期的时候我记得大概是 kimi k1 或者 K2 的时候,他们会选择用容器 runtime 来完成这种沙盒。在那种情况下很容易出现我们所谓的 OS panic 和内存的死锁,他们并没有选择让 agent 持续去跑容器或者换用别的虚拟机,而是干脆换了别的技术路线,把这种隔离做得更好。用了。File cracker 来跑这种 micro virtual machine,这个其实比较工程化。但是我觉得一句话 take the way,就是说他们选择赋予模型更高的权限,并且为这个权限做出更好的技术隔离。
01:34:56 3
OK 这个技术隔离是隔离什么和什么?简单来说就是。
01:35:00 2
希望如果一个 agents 把一个沙盒崩弄崩溃了之后,不会影响其他的沙盒的运行。
01:35:06 3
对这个安全的考虑对吧?
01:35:09 2
是的,说是沙盒做的更安全,那么模型的安全限制就可以放低。然后第二点是这个持久化 rot 和沙盒,其实解决的这个问题很经典,就是我们的 agented 的长尾问题。我们其实是否在 kimi 一个很厉害的地方,在 agented RO 领域有一个经久不衰的做法,叫做 partial roll out。简单来说就是一条采样轨迹可能是上千次的工具调用,得到了上百万个 token。然后假设我一次采样 16 个 request,这个 16 个 request 里面可能就会有那么一两条特别长的 request。比如说可能他是调一个外卖的接口,但是外卖的那个 mock 接口返回的比较不稳定,可能过了一分钟才返回。这种情况下会极大的阻塞这个 batch 的整个运行。
01:35:55 2
在 kimi 1K1.5 的论文里面,他们就提出 partial out,就是不必等待所有的轨迹都结束。等到一定比例的我们说的轨迹完成了之后,就会把结束的轨迹。用作训练,然后没有完全结束的轨迹会缓存起来,在下一轮继续去完成它。这个做法其实是有个很深厚的统计学的观察在里面的。就是说通过提高采样的总数,或者说只选择把不长尾的那部分的 request 拿来使用,可以加速这个采样的过程。这个也有一些强化学习理论上面的挑战,这是一方面。从系统设计上面,模型的历史的采样信息需要尽可能的保存。
01:36:38 2
比如说模型上次采用了 KV cache,他们需要把这个 KV cache 写下来,避免下次重新采样的时候需要做一次特别长的 long preview。然后另外一个问题是强化学习册的这个数据过时问题,用术语叫做 of poland mess。就是他这样采样的轨迹会有一个问题,可能这个轨迹的前这个部分是上一个版本的 check point 采样出来的,这个轨迹的余下部分才是当前版本的 check point 采样出来的。这样的话一条采样序列其实它不是严格的 on policy,或者说不是严格在线的。K3 还是采用了 per token 正则的方式,把我们所谓的策略更新约束在了一个局部领域之内,来部分容忍这样的 of policy ss,这是一个很经典的用算法上的宽容来换取 info 上的自由。然后其实对 infant 的提速是非常好的。
01:37:32 2
最后一点我觉得体现出来 KV 团队的一个设计哲学,就是让 RU 环境和推理时 agent 运行的环境是尽可能一致的。K3 的训练管道把 agent 的这个 hardness 表示成了一组可以配置可以组合的模块,类似于工具接口,system prom 上下文管理策略 skills have memory。他们用各种复杂的策略去模拟组合出来各种主流的 agent 的 honey。这种组合其实也避免了在模型训练过程当中 overfeed 到某一个 honey 上。以至于比如说你训练在美团上面订外卖,结果发现用户想要用饿了么就用不了。这些对人类而言是非常愚蠢的,但是对模型而言训练不佳很容易出现这样的问题。很显然他们这样的策略组合能够很好的缓解这种学会了美团就不会饿了么的问题。
01:38:22 2
从 infrared 的角度上来讲的话,我其实很认同他们这个方向。环境正确,就是说我们对 harness 的要求会逐渐提高的。更广的来说,我们希望 honey 能够自由的和各种 agent 的 workflow 做组合,这和我们在 semin 侧的想法也是一样的。不要为了每一个模型去做许多策略,要为了这些状态尽可能去组织成树状结构。
01:38:47 3
所以他的整个思路就是说我这个模型训出来之后,在上面一层就这个 harness 这一层,它不管是什么类型的哈尔斯,他都能比较好的去调用,它可以适配不同类型更多的框架。
01:38:58 2
理论上是这个样子,但是效果我觉得肯定不至于那么完美。但是我觉得现在这些 honey 的我们随着对 honey 的使用越来越高,对 honey 泛化性的要求也必然是越来越强的。
01:39:10 3
你觉得闭源模型有这个需要吗?比如说 s ARP c 或者 open I 它可能自己去的模型,它就是在自己的 hardest 框架里面被使用的对。
01:39:18 2
这个必然是需要的。而且换句话来说就是即便是 cloud code 这样的平台,它其实能够接入到的组件也是非常多的。类似 cloud code 可以直接 slack 可以接有还可以跟你的 calendar,这也是 most and highness。何况我刚刚提到美团和饿了么这个切换问题。可能对于 SOB 而言,他们可能换的就是用 gmail 还是用 outlook。对这两个事情听上去也非常的类似,但是不做精心的设计,模型的 over fitting 会非常的令人尴尬。
01:39:47 3
除了你刚才说的就是你自己最在意的这个进展。Agent eve 就是他们强化学习的环境之外,其他的一些改进,包括这个 flash KDA,还有它的量化感知念,这些你也可以展开讲讲,就是它在 inflation.
01:40:03 2
带来的一些变化是什么?我们回到下这两种 attention 的区别。Softmax attention 的 kernel 主要是在和带宽做斗争,然后线性注意力的 kernel 不严谨的来说,它会更多和串行依赖关系做斗争。具体来说 KDA 的话是在这个 chunk 之内做并行,chunk 之间做串行,以此 recurrent states 得以一个 chunk 一个 chunk 的往前传导。所以这种情况下最难用的一个写法就是每一个 chunk 你算一次,你就传一次状态,就会导致计算资源的大面积空转。
01:40:39 2
然后 flash KDA 是 kimi 他们团队基于 cut lus 写的一个 trunk west kernel,把 trunk 类的计算和跨 trunk 的状态传输尝试做重叠,术语来说叫 overlapping,这是 flash d 的第一。然后如此一来的话就带来一个差别。Soft max attention 的 KDA 的话,它对于 KV cash 的关注其实不会特别强。因为 kernel 对于 KV cache 是只读不改的。但是 KDA 的这些 kernel 的旧有状态可能会被覆盖,所以 kernel 的设计还需要考虑更全的生命周期。什么时候做持久化,写到哪一个 trunk slot 里面,怎么去保证其他 request 正在读的缓存不会被冲掉。可以说 KDA 的 kernel 会难度更高一点,而且它也模糊了我们认为 kernel 和缓存管理的这个界限。
01:41:28 2
然后另外一个角度是 kimi 的拿手技能,我们说的 QAT 就是 quantization awareness training。可以看到 K3 和 DP sig v4 同时都在采用 FP 负精度的一个训练。DVCV4 的具体做法的话,其实我们之前有讨论过,我们这里可以更多讲 K3K3 从 SFT 开始就做这个 QAT。然后这个直观的好处就是模型会有更多的时间去适应量化噪声,而且他们也着重强调了 RO 采样阶段和 training 阶段采用的是同一套量化方,这样尽可能的减少训练和推理不一致带来的磨损。
01:42:04 2
这个也可以从 RU 的角度上来感受。我们刚才其实提到一个术语叫做 of policies。直观来说 RU 策略梯度优化整个事情能够成立是有一个前提的。我正在优化的是产生的这些数据的策略。就是我们训练的时候会采集到许多的序列,然后拿去优化模型。我们希望这些序列就是我们优化的那一个模型产生的。它不是 T 减一的 check point,也不是 T 减 2 的 check point。它最好就是 T 减零这个 check point 产生的这个数据。
01:42:40 2
但是这个 T 减 0 或者 T 减 1、T 减 2,它有的时候不是你刻意造成的。就比如说我们说这个讯飞不一致,就是训练的时候可能他的这个电话,比如说是 BF16,那你推的时候采用 NVFP four,那么这就会导致其实这两个策略是有区别的这也是一种 of power less。所以一旦训练和这个采样的过程对同一个 chair point 给出的精度不一致,他给出的 token 的概率是有细微区别的这就是一个不严谨的梯度计算了。而且这种不严谨的梯度计算对于 MOE 而言,可能会导致一个灾难性的崩溃。
01:43:17 2
OK. 所以 K3 的训练哲学还是在贯彻 R1 info 领域的一贯的认识。为了我们殉道的模型,就是我们要去优化的一个模型。一定要让训练和推理阶段尽可能的契合,采用尽可能相似的配置。
01:43:33 3
这件事情它在实现上难吗?就说是现在大家其实主流的公司都能做到,就尽可能一样的配置,还是说这个还是需要挺多努力才能实现的,以及他其实也能去看一个公司大概 info 的水平。
01:43:46 2
我可以说这个事情非常难。而且对于很多公司而言,需要单独的去维护一个硕大的 inf 甚至说是 kernel team 才能够去把这个事情做好。这点上来说,我觉得 kimi 的技术就是还是非常领先的。
01:44:02 3
你之前说 deep seek 是 info 领域的巨星,那类比一下的话,你觉得 kimi 是在什么段位?
01:44:09 2
我不希望有一个分出高下的,但是坦诚来说,我觉得国内的公司的 inside 真的强我正上来说我们叫做用音符换算力,真的是非常不容易。
01:44:20 3
最后这一部分我有一个想补充的问题,就是我看 K3 在技术报告里他写到就 K3 优化测试里已经给他的原文写的是 alternative bar。有可能是个国内的芯片公司,给这个 alternative vender 的 GPGPU 写了科隆,那是不是有可能就用 K3 这个模型也能加速 K3 自己向国产芯片的适配了。
01:44:41 2
是的,我觉得这点应该是比较明确的。但是我不确定最终这个 delivery 上生产的这些是不是 K3 写的,但是 K3 至少从性能和正确性上来说是非常能打的。然后另外一个角度就是这一次我们也见到,由于现在这个模型的生态真的帮拼的非常厉害。以前有一段时间国产的芯片的同行,他们想要在模型发布当天 support 这些新的 AI 模型,其实是有一定难度的。但是到了最近我们也看到类似于摩尔县城,他们也通过 music 新浪的这样一个生态,在发布的很快的时间之内,我不记得是不是 daily,但一定是在极短的时间之内就成功 support 上了 kimi k3,而且也达到一个很好的效果。我觉得可以想见 kern nel development agents 真的是一个非常伟大的事情,我觉得对于整个芯片产业是有很本质的推动的。
01:45:32 3
你觉得这件事儿会怎么影响英伟达的统治地位吗?会吗?会到那个程度吗?
01:45:36 2
这事情都是我无法判断的事情。
01:45:38 3
你这是无法判断还是不想说?
01:45:40 2
我无法判断。
01:45:41 3
这个我们可以讨论一下。就理论上来说,其实因为库大这个生态就是建立在说你有比较丰富的科技,这肯定是很重要的一部分,对吧?
01:45:50 2
然后它的通用性比较好。我有很多好朋友在 MD 做 AMD version 的 cruelly,所以他们高强度的依赖这些 KDA。而且我也有 NV 的好朋友,他们在 NV 给 NV 写 next generation 的 DSL,也是大量依赖 KDA。
01:46:06 3
我觉得你这提供了一种视角,就是 KDA 这个东西英伟达之外的厂商可以用,对吧?那英伟达自己他也可以用。对。
01:46:13 2
因为英伟达自己也需要去更迭,然后我觉得很遗憾,就是现在这些模型的 KDA 还是优化 cute less 可能很厉害。但是如果你优化,比如说举个例子,假设你会有这个 TCG five 对吧?比如现在是 T 杠 4T 杠 5,就是可能 KDA 的还得花一段时间来是来泛化上去。
01:46:33 3
这也是个很好的问题。我们可以看看就是 KDA 这里指的是开发科 O 的这种 agent 的发展之后,会怎么去影响这个芯片领域的一些竞争。
01:46:44 2
我很难说 kimi delta attention 和 coral development agents 哪一个更伟大。我觉得这两个事情都很牛逼。
01:46:51 3
OK 都叫 KDA。我们最后可以再稍微延展讨论一下 K3 对业界的一些影响,有一些随便拍脑袋的问题。比如说你们认为下一个开源最强什么时候会出现。
01:47:02 2
可能来自哪个公司?首先我见到一个非常恐怖的事情,之前见到困团队发布说他们的模型在以日为单位智力更迭这个时代对智力前沿的加速度没有降低,反正我觉得是人类的想象力降低了。就是我们现在除了这个 coding 之外,我见不到下一个爆炸的点对。
01:47:21 3
就坤 3.8 preview 就预览版发的时候说他们会一日更新。下一个问题,其实前面稍微讨论过,就是你你们觉得今年内就剩下还有五个多月的时间里,我们有可能会见证开源超过闭园吗?我个人觉得。
01:47:35 1
这个是有一定难度的。因为一般来说大家会认为 open 跟双 P 他们内部的一个最强的模型,是比他们先放出来的模型还要再强一个。比如说半个 generation 的半个甚至到一个 generation 的对。然后我们现在开源模型,基本上现在最强的开源模型,基本上目标是追平现在已经放出来的这个叫做最强的闭眼模型,或者说闭权重模型。但是可能他们之后能够放出来的是他们现在内部已经有的比现在的权重模型还要更强,一个半代甚至到一代的模型。然后这个时候可能就是确实开权重模型还需要一段时间去追对。所以我觉得在至少未来五个月内,这个趋势应该不太会有很明显的变化。其实对于开始的模型,这边基本上就是把目前最强的给放出来了。对,所以这里其实还是有一个代差在这里的,就是时机最强的跟放出来的这个最强的。
01:48:26 3
你的意思是说要找一个好的时机来放?对,最后一个问题是一个相对趋势宏观趋势的一个问题。最近梁文峰说下一代模型的标志是能持续学习,你们自己会怎么看?下一代模型要实现什么能力?
01:48:42 2
就像我对于持续学习的观点,我不是说希望这个模型的智力不断提升,我是说希望一个模型能够对任何系统都有很有效的优化,但任何应该就专指 KDA。比如说我现在说可能你让 KDA 这句话现在 could less,它可以优化的很好。但是等到 next generation 的 DSL 来了,KDI 能不能做的很好,目前来看是不太行的这其实反过来暴露现在的模型的泛化性没有想象那么好,因为 chino 绝对是一个最好验证的领域了。对,哪怕这样子的话,它的二化都还需要一定的训练。那么你从这点上来看,我觉得实现 RSI 还是有一些距离的。
01:49:20 1
OK 我不去评价说下一代模型的核心能力是不是说必须要有持续学习能力这个观点本身,我觉得如果我们假设这个观点是正确的话,我觉得现在有个很大的问题是我们还没有一个很好的方式去评测或者说去 measure 这个 progress。就是说我们去看现在的模型,它做这个持续学习的能力大概到了什么样的层次。因为他肯定不是一个零或者一,就是他不会继续学习或者说会继续学习,他肯定是一个 0 到 1 之间的某一个状态。对我觉得现在还缺少这样的一个去衡量目前的进展的这么一个很好的方式。所以我觉得如果认可这个观点的话,我们应该先把这样的一衡量这个进展的方式给明确的做出来。比如说通过各种比较完备的 evaluation,各种完备的评测,把这个问题给解决。然后再去讨论说我们现在的模型离达到我们想要的目标还剩多少。
01:50:12 3
总体来说,你们觉得这个模型的进展,它接下来会是就一路这样斜线上去就可以这样进展了,还是他还是会有一个平台期出现。
01:50:22 1
我个人猜测也还是会有一个平台期的出现。
01:50:25 3
就是有平台其实有平台其实也意味着有突破,对吧?你有一个突破可能。
01:50:30 1
你就上一个台阶。对,但这个突破不见得说是大家都会想象那种特别巨大的范式性突破。我觉得可能更多是在 exception,在执行层面把一些问题有些突破之后,它会在这个平台期会有一个提升。其实说实话,个人觉得最近半年都没有什么很本质的平台性突破。对他只是在一个平台上有做的更高一点这样对当然确实更高一点,带给普通用户的体验已经很不一样了。
01:50:57 3
OK 今天非常感谢陈阳还有志远做客观点的分享了,对 K3 技术报告的一些解读。然后我们也从 K3 的一些改进,比如说它的线性混合的注意力 attention reduce 等等。然后延展到了最近这些领域相关的一些进展。包括这些进展是为了解决什么问题,以及接下来可能会有怎么样的影响。我们也讨论了 K3 现在在全球或者说在美国的科技圈引起的这种开源的辩论。今天的节目就到这里。
01:51:28 1
各位拜拜拜拜。
01:51:29 3
再见,拜拜。本期连点呈现推荐晚点聊几个相关的往期节目。一期是我们这次反复提到的,第 163 期对 DB sik v4 的解读。其实这两期节目的结构挺相似的这是因为现在开源大模型的技术报告的结构本身就有一定的共通性,会有几个绕不开的模块。首先是架构层的注意力机制,这是大语言模型里非常关键的一部分。这次陈阳也说,attention 机制就是我们 AI 领域研究的特修斯之这个词的本意是关于事物同一性的哲学比喻。如果一艘船的所有部件逐步被替换,直到没有原始材料被保留,那它还是原来的那艘船吗?其实我们现在对 transformer 的改造,我们试遍所有配方的方式,就有点类似于边行船边换零部件。而这意味着 transformer 这个大的方向继续往下,可能还有很多改进的空间。
01:52:25 3
另一个绕不开的是层与层之间的信息连接方式。在 V 四里我们讨论了 MHC 它是怎么从字节最开始提的 HC 改进而来的。在 K3 里我们讨论的是 attention 的 ce kimi 今年春天提出的这个方案本身也是受到了 MHC 的一些启发。
01:52:42 3
同时我也推荐过往多期节目里我们讨论过的注意力机制。一是第 103 期,用 attention 串起大模型优化史。这是在 25 年 2 月录制的,它特别好的一点是对非从业者相对友好。两位清华当时在读的博士生肖朝军和傅天宇,深入浅出的串讲了 attention 机制诞生的过程,原初版本的瓶颈、它的改进历史和背后的计算机与深度学习思维脉络。简单来说,注意力的改进一直是在服务于上下文的不断拓展,大家追求的是希望上下文越来越常识,计算和存储的开销不会爆炸,也就是一方面要提升效率,但同时又不降低性能。
01:53:26 3
然后是 104 期与当时 mini max 的高级研发总监钟怡然聊线性注意力方向的改进。这也是我们 K 三这一期 Q 到的 mini max 在 M1。这是 25 年年初的一个模型上,就大胆的使用了线性注意力的这件事儿。这也是业界第一个在这么大规模的模型上用线性注意力的尝试。
01:53:47 3
更近的一期是去年底发布的 143 期节目,这次是和 delta net 的核心作者杨松林来聊线性注意力的优化。当时松林是在博士的最后一年,她现已经加入了 TMLKDA 里的 D 就是 delta 的意思。那会儿的背景是 25 年的九月和 10 月,阿里和 kimi 都发布了和 delta net 相关的注意力改进成果。Kimi 当时的那个用在 kim inner 模型上的注意力改进,就是现在 K3 里用的 KDA。这期我们也聊到了,KDA 是从当初 KM 的这样一个 38B 的小模型构到了现在 3T 的规模。这也是一个挺具体形象的例子。它展现了现在的模型研发中是怎么一步步从小规模的实验在网上 skill 的历程。期待下一次的技术解读可以在我们关于 AI 的意义网络中再点亮新的一点。
01:54:43 3
本期节目就到这里,感谢收听。如果你对今天聊的话题有观察、好奇和疑问,欢迎在评论区分享想法。这也会成为我们节目的一部分,让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友,推荐更多你想听的主题和嘉宾。你可以从小宇宙苹果 podcast 等渠道关注晚点聊 late talk,也欢迎关注我们的公众号,晚点 late post,下期再见。
Click any line to jump · Hover to ask AI
Content Overview
K3 模型,由中国团队开发,采用混合注意力机制和深度方向注意力减少技术,显著提升长上下文处理能力和计算效率,尤其在代码生成领域表现突出。通过多教师在线蒸馏和量化感知训练,K3 优化了后训练过程,提高了模型泛化能力。K3 的开源引发了对数据安全、模型迭代速度及产业链影响的讨论,展示了开源模型在技术传播和成本控制方面的优势,同时也凸显了闭源模型在环境、验证和算力上的局限性。K3 的成功标志着开源模型向高性能迈进的重要里程碑,预示着未来模型设计将更加多样化和高效,同时也开启了对模型持续学习能力和跨领域合作重要性的探索。
#### Speaker Summaries
发言人3
他主持的晚点聊节目,深入探讨了 K3 模型的技术亮点,包括 3T 开放权重、混合注意力机制和智能体训练环境。他强调了开源模型与闭源模型的差异及其对业界的影响,指出 K3 在美国 AI 界引发的关注和开源大辩论,展现了 K3 对业界的潜在影响和未来模型发展的趋势。此外,他还推荐了几期相关往期节目,旨在帮助听众更全面地理解注意力机制和模型优化的历史与进展,展现了其对 AI 领域深入理解和广泛涉猎。
发言人1
他,清华大学计算机系本科毕业,现为华盛顿大学 CSPHD 二年级学生,专注于语言模型的后训练和评测研究。他认为国产模型 K3 在长程任务处理上表现优异,但处理紧急任务时速度较慢。K3 通过创新的混合注意力结构和专家负载均衡技术,成功支持百万级上下文长度,展示了开放权重模型在 3T 级别的里程碑式进展。他强调优化器设计和小规模实验验证对大规模模型训练的重要性,同时指出持续学习能力评估的必要性。K3 在数据构建、模型训练流程上的优化,以及多领域专家模型解耦训练的策略,展现了其在模型开发领域的深入思考和独到见解。
发言人2
他将 AI 领域的发展比作忒修斯之船,尽管组件不断更新,但核心注意力机制得以保留,特别是 K3 模型的创新设计,如线性与全局注意力的混合,以及深度方向上的注意力,体现了架构的灵活性与可组合性。他强调安全是 AI 研究的关键,无论是开源还是闭源模型,都应加强安全审查。对于开源模型,他指出环境与验证能力比权重开放更为重要。此外,K3 在工程优化上取得了显著成就,如前缀复用和投机采样技术,验证了线性注意力架构在长文本处理上的优势。最后,他提出持续学习与泛化能力是未来研究的重点,而 RSI(递归自我改进)的实现仍面临挑战。
K3 开源 模型 权重 混合注意力 智能体 训练环境 长程任务 代码 前端能力 安全 评测 数据 强化学习 架构 post training 资本 美国 辩论 风险
Content Overview
「开源了权重,没开源产生权重的 “流水线”。」本期我们邀请 RadixArk 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 K3:它真的比肩 fable 吗?3T 开放权重、混合注意力和智能体训练环境意味着什么?以及开源模型真正开放了什么、又保留了什么?
晨阳是老朋友,他曾在 163 期节目中为我们从 Infra 角度解读了 DeepSeek-V4。在 UCLA 读博期间,晨阳成为 SGLang 核心开发者,SGLang 第一时间适配了 V4 、K3、GLM 5.2 等中国开源模型。
曾致远目前在华盛顿大学读博士二年级,研究大语言模型,师从 Hannaneh Hajishirzi 教授和 Pang Wei Koh 助理教授。
进入具体的技术报告解读前,我们也聊了 K3 如今在美国 AI 界和更广泛的投资市场所引起的巨大关注,以及与 K3 直接相关的开源大辩论。
下面,正式进入节目吧。 本期嘉宾:
* 赵晨阳,RadixArk 与 SGLang 创始成员 * 曾致远,华盛顿大学计算机科学博士生 本期主播:
* 曼祺,《晚点 LatePost》科技报道负责人 时间线跳转: -K3 为什么成为里程碑 05:13 使用体感:长程任务、惊艳的前端能力与被吐槽的不足 11:15 K3 引发的开源、安全与估值大辩论 16:50 Transformer 的「忒修斯之船」 25:34 贵不贵、慢不慢,看单价之外的任务总成本 29:25 K3 为什么现在慢?新架构、Serving Stack 与前缀复用 34:42 权重一旦开放就收不回;真正的护城河在环境、验证和算力 -KDA(K3 采用的注意力) 和 KDA(kenerl 开发 agent),说不好哪个更伟大? 39:36 架构总览:让信息沿序列与深度更高效流动 42:42 Quantile Balancing:近千个专家如何保持负载均衡 48:38 KDA+MLA:线性注意力与全局注意力并非二选一 54:12 线性注意力下,百万上下文如何缓解遗忘 57:27 线性注意力给推理系统带来的工程变化 01:00:54 6.3 倍解码加速来自哪里 01:03:34 Attention Residuals:让深层模型选择性读取浅层信息 -优化器、后训练与自动研究 01:10:23 Per-head Muon 与大规模训练稳定性 01:14:46 AI 能否自己发明优化器 01:20:34 MOPD:九个领域专家为什么先分后合 01:27:11 蒸馏的纯技术定义、on-policy 蒸馏与 off-policy 蒸馏的区别 -Infra 优化 01:31:08 KDA 结构下,投机采样回退机制的变化 01:39:47 Flash KDA、QAT 与训练—推理一致 -后面有什么? 01:46:50 下一个开源最强,以及开源能否超过闭源 01:48:29 持续学习、评测与模型平台期 剪辑:甜食 相关链接: Kimi K3 官方技术博客 Kimi K3: Open Frontier Intelligence(技术报告) Kimi Linear: An Expressive, Efficient Attention Architecture Open Weights and American AI Leadership
163 期:详解 DeepSeek V4:Infra 巨鲸、百万上下文走进现实、极致效率优化
143 期:阿里、Kimi 都在用的 DeltaNet 是什么?|与杨松琳聊线性注意力新改进
104 期:我给线性注意力找“金主”,字节 say No,MiniMax say Yes
103 期:用 Attention 串起大模型优化史,详解 DeepSeek、Kimi 最新注意力机制改进 详解 DeepSeek V4:Infra 巨鲸“四连击”,百万上下文走进现实 再谈注意力:阿里、Kimi 都在用的 DeltaNet 和线性注意力新改进丨晚点播客 3700 次预训练寻找“线性注意力”非共识,MiniMax-01 开发者讲述 4 年探索 大模型“注意力简史”:与两位 AI 研究者从 DeepSeek、Kimi 最新改进聊起 附录:
* KDA(Kimi Delta Attention):Kimi 提出的线性注意力机制,用固定大小的循环状态压缩历史信息,降低长上下文的计算与存储开销。 * Flash KDA:KDA 的高性能 Kernel 实现,通过重叠 chunk 内计算与 chunk 间状态传输,减少计算空转。 * Kernel Development Agent(KDA):用于编写、测试和优化 GPU Kernel 的智能体;缩写同样是 KDA。 * MLA(Multi-head Latent Attention):通过低秩表示压缩 Key-Value Cache;K3 用少量 MLA 层补充对全局上下文的直接访问。 * 混合注意力(Hybrid Attention):在同一模型中组合不同注意力机制;K3 采用 3 层 KDA 搭配 1 层 MLA。 * NoPE(No Positional Encoding):不显式加入位置编码,序列位置信息主要由 KDA 的递推、门控与衰减提供。 * Attention Residuals(AttnRes):让模型选择性读取较浅层的历史表示,改善信息沿深度方向的流动。mHC(Manifold-Constrained Hyper-Connections):DeepSeek V4 的多通路残差连接方案,与 AttnRes 都用于改善层间信息流。 * MoE(Mixture of Experts):每个 token 只激活少数专家子网络,以较低计算量承载更大的总参数规模。 * Stable LatentMoE:K3 的 MoE 方案,共有 896 个路由专家,每个 token 激活其中 16 个。 * 负载均衡(Load Balancing)与 Quantile Balancing:负载均衡避免 token 过度集中到少数专家;K3 按路由分数的分位数分配专家。 * Muon、MuonClip 与 Per-Head Muon:Muon 对更新方向做近似正交化;K2 用 MuonClip 稳定注意力,K3 则按注意力头分别优化。 * 知识蒸馏(Knowledge Distillation):让教师模型把能力传递给学生模型,可用于模型压缩或多种能力合并。 * Checkpoint:训练过程中保存的模型参数及相关状态快照,可用于恢复、比较或更新模型。 * 消融实验(Ablation Study):移除或替换某个组件并比较效果,以判断它是否真正有贡献。 * MOPD(Multi-Teacher On-Policy Distillation):K3 先训练多个领域教师,再把它们的能力在线蒸馏进统一学生模型。 * On-policy 蒸馏:学生生成轨迹,教师对这些轨迹提供监督,数据分布更贴近学生当前策略。 * Off-policy 蒸馏:学生学习教师预先生成的数据,实施更方便,但可能存在分布偏移。 * 投机采样(Speculative Decoding):小模型先猜一批 token,大模型再集中验证,以提高生成速度。 * 前缀缓存(Prefix Cache):复用相同提示词前缀的中间计算结果,避免重复计算。 * Persistent Rollout:未完成的长轨迹可暂停并在后续轮次继续,减少长尾任务对整批采样的阻塞。 * Off-policy Mismatch:训练数据并非由当前模型策略生成,常来自旧 Checkpoint 或不同的推理配置。 * Agent 训练环境与 Harness:环境提供工具、沙箱和奖励;Harness 组织提示词、工具、上下文、Skills 与 Memory。 * QAT(Quantization-Aware Training):训练时模拟低精度计算,让模型提前适应量化误差。 * 忒修斯之船(Ship of Theseus):节目用这一比喻形容部件不断被替换、却仍沿用 Transformer 名字的模型架构。 * 持续学习(Continual Learning)与 RSI:持续学习指模型从新任务和反馈中继续更新;RSI 指系统递归改进自身能力。 小红书@曼祺_火柴Q即刻@曼祺_火柴Q
!Image 2 ☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆
欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。
这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。
请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。
!Image 3 关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章:
Make your daily reading actually fit you.A daily brief built from the sources you follow. Get started free
00:00 / 00:00