← 回總覽

第二个 Deepseek 时刻来了?!

📅 2026-07-18 20:26 格兰投研 人工智能 4 分鐘 4094 字 評分: 82
AI 模型 AI 商业化 AI 硬件与芯片 投资与市场 科技新闻
📌 一句话摘要 本文解读 Kimi K3 大模型发布对中美 AI 竞争格局及 AI 芯片投资逻辑的冲击,认为其虽不意味着算力需求下降,但打破了美国闭源模型的领先壁垒,并利好国产算力产业链。 📝 详细摘要 文章以月之暗面发布的 Kimi K3 开源大模型为切入点,分析其被市场称为“DeepSeek 2.0 时刻”的原因。作者指出,K3 带来的第一层冲击是中美 AI 模型能力差距进一步缩小,其 2.8 万亿参数和测试成绩直逼美国最强闭源模型。更深层的冲击在于,它重现了 DeepSeek 对 AI 芯片投资逻辑的挑战:模型效率提升和开源低价可能压缩云厂商的资本开支回报率,改变市场对算力硬件无限增

82

This article analyzes the impact of the Kimi K3 large model release on the Sino-US AI competitive landscape and AI chip investment logic, arguing that while it doesn't mean computing power demand will decrease, it breaks the barrier of US closed-source model dominance and benefits the domestic computing power supply chain. 格 格兰投研

Yesterday 2578 words (about 11 min) View Source →

Sign in to highlight text and take notes as you read. Sign in now

原创 格兰 2026-07-18 20:26 北京

!Image 1

新的格局

昨天 A 股下跌,大家心情比较郁闷。一觉醒来发现,老美那边也没好到哪去,同样是 kuku 一顿跌,费城半导体指数最大跌幅达到 5.6%,本月跌幅接近 20%,对着比惨了属于是。

是谁暗戳戳的给美国科技股又捅了一刀呢?

是我们月之暗面发布的 Kimi K3。

!Image 2

这个大模型拥有 2.8 万亿参数的开源大模型,主打低 API调用 价格、原生超长上下文,同时具备较强的推理和视觉能力。

简单说,给老美带来了亿点点震撼。小摩直接起名,把这个叫作“DeepSeek 2.0 时刻”。

为什么反应这么大?

Kimi K3 带来的第一层冲击,是中美 AI 大模型在能力差距上的继续缩小。

!Image 3

虽然 Kimi 官方说着 K3 的整体性能仍然落后于 Claude Fable 5 和 GPT 5.6 Sol 这两款最强的闭源模型,但发出来的数据可谁也没惯着。

就差把“你们老美大模型得加把劲了,再不努力就要被我超过”直接说出来了。

更让华尔街嗅到熟悉的味道,是 K3 对 AI 芯片板块带来的冲击,像极了当年的 DeepSeek。

过去市场给 AI 芯片高估值,依赖的是一条非常简单的链条。

模型参数越来越大,训练和推理需要的算力越来越多,云厂商必须持续扩建数据中心,采购更多 GPU、存储芯片、先进制程晶圆和半导体设备。

只要算力需求不断上升,英伟达、台积电、存储厂商和设备公司的收入就可以持续增长。即使这些公司的股价已经涨了很多,投资者仍然愿意给出更高估值,因为大家相信 AI 资本开支还远没有结束。

当时因为 DeepSeek 的出现,投资者突然发现,大模型能力继续提升,并不一定意味着算力投入必须按照原来的速度无限增长。模型效率提高、推理成本下降、开源生态扩大,都可能改变企业采购算力的方式。

Kimi K3 发布以后,这套逻辑再次被摆上桌面。这就意味着,模型使用量可以继续增长,但硬件采购量未必会按照原来的速度同步增长。

实际上,K3 和 DeepSeek 还不太一样。

DeepSeek 第一次震动全球市场,核心是用相对有限的算力和成本,做出了接近老美顶级闭源模型的能力,打破了市场对算力投入、模型能力和商业定价之间关系的固有认知。

但 K3 带来的冲击,并没有证明大模型不需要算力。

恰恰相反,Kimi K3 非常大,对计算集群、显存、互联带宽和推理系统的要求都很高。

它真正打破的是另一个认知,老美闭源模型在复杂工作能力上的领先,可能没有市场原来想得那么牢固。

老美科技公司投入越来越多钱搞 闭源模型,可还是被我们的 Kimi K3、GLM 5.2 等开源模型不断接近,换谁都要琢磨琢磨,这种 优势还能维持多久。

此前云厂商不断加大数据中心建设,市场愿意接受这种投入,是因为相信 AI 需求足够大,未来可以通过模型订阅、API 收费和企业服务收回成本。

但低价开源模型不断出现以后,模型价格很容易被压低。

模型调用价格越低,企业用户当然越愿意使用,但对提供算力和模型服务的公司来说,收入增长未必能够覆盖快速上升的资本开支。

钱花得越来越多,模型服务却越来越便宜,这会直接压缩整个行业的投资回报率。

这样一来,像台积电、阿斯玛上调资本开支,在资金眼里的叙事逻辑就会从先进制程和半导体设备需求旺盛,转变为现在大规模建设芯片产能,未来会不会形成产能过剩。

事没有变,思考方式变了,结果也就不一样了。

Kimi K3 真有这么大威力吗?来听听刚和业内专家交流后的最新消息。

按参数看,是比较超预期的。在国内主流大模型大多还在万亿以内的环境下,K3 直接把参数推到接近 3 万亿这个级别。

虽然参数大不等于能力一定强,但参数规模仍然是评价模型能力的一个基础。

到了这个规模水平,如果还按照传统模型架构直接堆参数,训练和推理成本都会非常高。

所以 K3 在架构上做了三层优化。分别对应 注意力机制、残差连接和专家模型。

!Image 4

注意力机制采用的是此前 Kimi 提出的 KDA 混合线性注意力,采用了三比一的混合注意力结构。

三部分使用混合线性注意力,一部分使用全局注意力。

说简单点,就是模型在阅读长文档、处理长代码或者执行长时间任务时,不需要把所有历史信息都按照原来的方式完整保存。保留好关键词信息的同时,维持对全局内容的理解就好了。

有点像上学时背古文,关键句子记下来,按根据内容脉络串起整篇文章。

残差连接用的是全新 Transformer 学习架构设计,Attention Residuals。

在原有固定累加方式基础上加入动态跨层路由机制。

模型会根据当前输出,自主选择需要复用哪些早期层的信息。按照官方数据,这项设计在额外成本增加不到 2%的情况下,可以提升约 25%的训练效率。

专家模型方面,则是在混合专家MoE架构上进一步创新,提出了LatentMoE潜在专家混合架构。

我们可以这样理解,MoE 是把输入信息直接交给专家路由系统,再决定由哪些专家处理。

K3 在这一步之前增加了一个压缩过程。模型会先把表示压缩到低维空间,再进行专家路由。这个思路和 DeepSeek 此前提出的 MLA 有些类似,核心都是减少无效计算。

区别在于,MLA 主要针对注意力层进行压缩,Kimi K3 的 LatentMoE 则主要针对信息进入专家层之前的路由过程进行压缩。

在投资层面,大家最关心的问题是,Kimi K3 这次大突破,是不是可以理解成算力需求下降?

不好意思,不能。

K3 降低的是同等智能水平的使用成本,不是让算力变得不重要。

可以理解成,我们可以开车油耗降低了,车主愿意多往外旅游跑一跑,但汽油该用还是要用。

按这个思路分析,对国产算力是明确的利好。

Kimi K3 不是小模型,参数越大,越需要超节点这类的机柜级计算系统。

从 GPT 到 Sora,再到各种智能体,大模型能力不断提升,参数量和计算需求还在继续增长。

我们只能通过扩大节点规模,增加芯片数量和总显存容量,实现更大模型的装载和运行。

用错位竞争,去尽量抹平与老美算力上的差距。

芯片只是起点。芯片之后是卡间互联,互联之后是高速存储,存储之后是先进封装,封装之后是液冷和材料,此外还要叠加算子、软件和系统调度。

任何一个环节掉链子,都会影响整台超节点的性能。

这些真正有持续价值的环节,正在撑起我们科技的脊梁。

Kimi 已经帮我们证明了国产模型有能力站在全球前沿,下一次较量,该比一比谁能把前沿能力,变成稳定生产力了。

!Image 5: 图片

_申文冠_ _执业编号:A0670623050002_

_云南约牛软件技术有限公司_

_风险提示:股市有风险 入市需谨慎_

周内:每日解读,独家视角看大盘

周六:要闻精选,纵览国内外大事

周日:每周策略,周一开盘前必读 !Image 6: 图片点“喜欢”和“赞”,给我充点儿电吧~

查看原文 → 發佈: 2026-07-18 20:26:00 收錄: 2026-07-19 08:00:27

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。