← 回總覽

Kimi,“等芯来”

📅 2026-07-23 14:31 腾讯科技 人工智能 5 分鐘 5343 字 評分: 89
Kimi K3 模型 Scaling Law 算力焦虑 国产算力
📌 一句话摘要 本文探讨了 Kimi K3 模型在验证 Scaling Law 的同时面临的算力紧缺挑战,并分析了国产算力在降低 Token 成本、支撑大模型商业化中的关键作用。 📝 详细摘要 文章深入分析了 Kimi K3 模型的技术突破及其引发的行业震动。K3 通过 KDA、AttnRes 等架构优化实现了 2.8 万亿参数的规模,证明了 Scaling Law 的有效性,甚至引发了硅谷巨头的焦虑。然而,极高的热度也带来了严重的算力焦虑,导致 Kimi 暂停新用户接入,反映出算力供给与用户增长之间的失衡。文章进一步探讨了从“算力供给”到“Token 经济性”的转变,强调国产算力(如华为

89

This article explores the Kimi K3 model's validation of the Scaling Law while facing a compute shortage challenge, and analyzes the crucial role of domestic compute in reducing token costs and supporting large model commercialization. ![Image 1: 腾讯科技腾讯科技](https://www.bestblogs.dev/articles?sourceid=b475c7 "View More From This Source")

Yesterday 3884 words (about 16 min) View Source →

原创 值得关注的 2026-07-23 14:31 北京

!Image 2

@国产算力。

!Image 3

Kimi创始人杨植麟。图片经由AI生成

文|苏扬

编辑|徐青阳

Kimi K3最近大火,美国科技圈的一些人开始反思:为什么杨植麟卡内基梅隆博士毕业后,不留在美国创业?

作为年度最强开源模型,Kimi K3的参数量达到了3T级别,并在各大基准测试中“屠榜”,一部分榜单表现甚至超越Fable 5这种美国实验室的最前沿模型。

在算力不足的情况下,通过算法、工程的优化,叠加参数的扩展,不仅追上前沿闭源模型的性能,打破Scaling Law“撞墙”一说,甚至还引发了一部分硅谷巨头的焦虑与恐慌。

OpenAI战略负责人迪恩·W·鲍尔说:“开源模型会阻碍人工智能领域的进一步资本支出。”

这不难理解,大家都在探索AGI,你来做的话需要10块钱,而别人只需要1块。那么,你就需要论证多出来的9块钱的必要性、合理性。对于年度资本开支7000亿美元的硅谷巨头来说,如果答案是否定的,人工智能产业将迎来一轮史无前例的“泡沫破裂”。

不过,“搅局”的同时,Kimi很快遇到了自己的第一个难题:算力焦虑。

01

一封充满算力焦虑的信

7月19日晚间,Kimi发通知信暂停新用户接入,暂时性关上了新用户体验Kimi K3的通道。

通知信大意是:热度高、需求超预期、存量算力不够且逼近极限。不得不暂停C端新用户订阅,将已有算力分配给存量用户,直至新算力到位再陆续开放更多订阅名额。

“暂停”增量用户接入与“Token Plan”限售,虽然都源于算力紧缺,但二者略有不同。

过去,国内模型推理算力不够,通过“Token Plan”限售的方式开一个口子提供服务,起码意味着有供给空间,也能够在后续通过API接入转化重度用户。直接“暂停”接入,把增量用户拒之门外,意味着算力供给上没有任何腾挪的空间,可见现阶段Kimi的算力紧缺程度。

“它自己的算力都没法批量获取,现在这么多用户想用都没法开通付费账户,这严重影响商业变现和用户口碑。”一位资深科技投资人说。

长期关注中国科技产业发展的上海财经大学教授胡延平认为,Kimi暂停新用户接入的原因是算力准备不足,而非ROI没有转正。“因为算力约束,接不住泼天的用户,目前比ROI转正更重要的是接住用户。”

关于ROI的问题,胡延平认为只从“算力/token”来看问题,有可能出现用户token消耗越多亏损越大的情况,只有从“算力成本效率/token”来分析,才能看清算力约束的真实涵义。

“类似Kimi接不住用户这种情况,除了需要有更合理的资费、更多的算力卡,更重要的是要有能效比、量效比更高的算力卡和算力集群。”一位接近Kimi的知情人士透露,暂停新会员订阅后,找算力成为他们的头号任务。

“我们已经在非常努力地通过模型性能的优化和算力供给来解决问题。”Kimi企业业务负责人黄震昕日前在沟通会上说。

Kimi在寻找算力的同时,智谱1GW纯国产算力的消息却被释放出来。这也引发多位国产算力从业者的讨论,核心在于智谱从哪里能够获得如此天量规模的算力。

以刚刚在2026世界人工智能大会(WAIC)上亮相的华为昇腾Atlas 950超节点为例,仅按64卡机柜100KW功耗上限来换算,不考虑交换设备1GW相当于10000个Atlas 950机柜,即640000张NPU。再假设单卡价格是20万元,整个1GW的订单,算力部分超过1200亿元

即便考虑国产卡价格差异,按照平均单价10万元算,1GW纯国产算力,也将是一笔超600亿元的算力大单。若消息准确,对国产算力来说将是一个巨大利好。

02

先找路,再找钱

“从目前披露的信息看,K3暂未呈现出范式级的全新架构。”期智研究院研究员李彪告诉腾讯科技。

KDA和AttnRes此前已有论文,本次更值得关注的是将这些模块与极稀疏MoE、低精度训练和大规模并行系统整合,并扩展到2.8万亿参数。 “由于K3完整技术报告尚未发布,目前仍难以评估其全部技术增量。”李彪补充说。 《Kimi K3不是中国的Fable 5》一文中提到,KDA让序列计算更便宜,AttnRes让深度信息流更智能,Stable LatentMoE让参数容量更庞大——三者共同构成了Kimi K3的架构骨架。算得更省、流得更顺、装得更多,共同成就了2.8万亿参数的Kimi K3,以及它在开源生态和整个大模型领域的影响力。

“Kimi K3 再次说明‘size still matters’。”李彪强调说。

他认为,模型规模仍是提升前沿能力的重要变量,但规模能否有效转化为能力,取决于架构、数据配比、优化方法和基础设施的共同配合。“对于2.8万亿参数的极稀疏MoE模型,当前更显性的工程约束来自功耗、通信开销、专家负载均衡和集群可靠性。从其能够支撑2.8万亿参数MoE训练来看,Kimi应该在底层Infra上做了不错的优化。”

另一位学术研究员也认同训练过程中Infra、工程能力的重要性,“大家思路都大差不差,归根结底变成软件工程了。”

前述科技投资人告诉腾讯科技,中国公司再一次在较短时间内把开源模型推到接近全球闭源旗舰模型的水平,“我觉得还是非常厉害。它给我的冲击是Scaling Law还在继续当前最前沿的模型训练配方,中国公司也可以快速掌握。”

如果把上述研究员、有投资人的观点综合到一起,可以归结为:Kimi通过Infra、工程的手段,找到了一条持续Scaling Law的路,这不仅是Kimi自己的路,也是中国开源模型生态的路。

所以,Kimi K3亮相后不久,2.4万亿参数的Qwen 3.8预览版也宣布上线了。

当可靠的Scaling Law路径有了,剩下就是找钱的问题。

在一级市场,过去半年Kimi一直是“当红炸子鸡”,融资相关的传闻不断。根据外媒披露的数据,Kimi计划8月启动上市前最后一轮融资谈判,目标估值为500亿美元。这相当于DeepSeek的上一轮融资完成后的估值。同期,Kimi也拆VIE架构,加速赴港上市流程,冲击继智谱、MiniMax之后在港股上市的“大模型第三股”。

如果时间倒退至2025年12月31日,彼时杨植麟发内部信确认完成了5亿美元的C轮融资。

“当前现金持有量超过100亿元。相比于二级市场,我们判断还可以从一级市场募集更大量资金,事实上,我们B/C轮融资金额就超过绝大部分IPO募资及上市公司的定向增发。所以我们短期不着急上市。”杨植麟在内部信中说。

资料显示,Kimi的C轮完成后,投后估值43亿美元,对比外媒报道最新的Pre-IPO轮500亿美元估值,半年涨幅12倍

半年之前,杨植麟判断可以从一级市场拿到更多的钱,这个点后续被时间验证了,但100亿元的现金在7个月之后,在Kimi K3被迫暂停新用户接入之后来看,显然不够用。

03

中国芯片的第二场战争 KimiK3目前证明的是技术能力进入前沿,还没有完全证明推理经济性、产品体验和商业模式同样成立。”前述科技投资人说。

根据Artifacial Analysis的“智能指数”评测,Kimi K3在全部9项测试中总共产生了约1.3亿个输出Token,高吞吐量导致跑完整套评测的总账单高达2709.75美元。相比之下,同类参评模型的中位数仅为6300万个。

拆分成单一任务,Kimi K3的平均花费仅为0.94美元,GPT-5.6 Sol为1.04美元,Claude Opus 4.8为1.8美元。

单看定价,Kimi K3的token已经不便宜了。而Kimi自身关于这个问题的解释是:中国开源模型不应该被贴上性价比标签,SOTA模型应该有自己的定价权。

不过,对于用户而言,追逐性价比就是追逐更高经济性。放在Kimi K3身上,如果Token输出量压缩一半,那么成本也就对应会压缩一半。这与胡延平教授提出的量效比高度一致。

他说,如果不考虑量效比,长期竞争会是问题,“某些时间点会出现token不经济

胡延平以英伟达为例,强调在H200上,token的ROI下可能是亏的,但升级为B300可能分分秒秒都是“印钞机”。这其实给国产算力提出了一个新的要求,既要给国产模型保证算力供给,也要在硬件层面释放token的经济性

SemiAnalysis 5月份报告显示,在MiniMax-M2.5的8K/1K负载下,B200 NVFP4凭借硬件与内核优化,在高吞吐交互下(单用户速度提升至110 tok/s/user),每百万token为0.09美元。作为对比,H100 FP8在统一的条件下,每百万token 0.74美元,实现了超过8倍的每美元性能提升(性价比)。

!Image 4

高交互负载下,B200 NVFP4 较 H100 FP8 运行Minimax 2.5成本对比

关于国产算力的进化,今年的世界人工智能大会(WAIC)出现了一些比较好的趋势。最典型的就是2025年的华为CloudMatrix 384和2026年的Atlas 950两代超节点的进化——单柜从32卡到64卡,计算密度翻倍;计算柜也从12个增至16个。机柜内部采用高密度铜缆电互联,机柜间采用全光互联,从支持千亿参数模型的训练,扩展至万亿参数模型的低精度训练和混合推理。

这种变化,不去现场看,不做对比,很难直观地感受到差异。 《2026,中国芯片为国产模型“托底”》里提到了国产算力进化背后的一些花絮,其中最具代表性的是国产算力从业者都表现出了不同程度的喜悦、开心,这里面有几个原因:公司上市,很大一部分员工获得了股权激励;同时,市场开始为中国芯片重新定价,逐步放大这种财富效应。

如果说上市是中国芯片的第一场战争,那么接住国产大模型的需求,为其token成本托底,将成为关键的第二战。

!Image 5

推荐阅读

查看原文 → 發佈: 2026-07-23 14:31:00 收錄: 2026-07-24 02:00:45

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。