← 回總覽

黄仁勋为何力挺梁文锋、杨植麟?

📅 2026-07-28 18:35 腾讯科技 人工智能 2 分鐘 1471 字 評分: 88
大模型 模型架构 算力围墙 混合专家模型 长上下文优化
📌 一句话摘要 文章剖析中国大模型公司通过重塑 Transformer 关键部件、混合专家模型和长上下文技术,突破算力与数据壁垒,并解释黄仁勋为何公开支持梁文锋、杨植麟的背后动机。 📝 详细摘要 本文聚焦中国大模型在算力围墙与数据墙双重约束下的技术突围。作者详细阐述了 Kimi 系列模型(K2.5、K3)如何将注意力、残差连接、优化器等核心部件重新设计,采用 MoE 混合专家、KDA 线性注意力、门控 MLA 等混合架构,实现参数激活率提升、显存占用大幅下降,并通过多 token 预测、共享 KV 缓存等手段压缩推理成本。文章进一步分析了算力与存储成本的演化、长上下文优化的四步路线以及商业

📌 一句话摘要

文章剖析中国大模型公司通过重塑 Transformer 关键部件、混合专家模型和长上下文技术,突破算力与数据壁垒,并解释黄仁勋为何公开支持梁文锋、杨植麟的背后动机。

📝 详细摘要

本文聚焦中国大模型在算力围墙与数据墙双重约束下的技术突围。作者详细阐述了 Kimi 系列模型(K2.5、K3)如何将注意力、残差连接、优化器等核心部件重新设计,采用 MoE 混合专家、KDA 线性注意力、门控 MLA 等混合架构,实现参数激活率提升、显存占用大幅下降,并通过多 token 预测、共享 KV 缓存等手段压缩推理成本。文章进一步分析了算力与存储成本的演化、长上下文优化的四步路线以及商业定价策略,指出随着单 token 成本下降,新的高并发、长上下文需求将推动整体算力需求上升。最后,作者解释了英伟达 CEO 黄仁勋在美国政策争议期间公开支持中国模型研发的动机,认为开放权重有助于扩大芯片生态,提升英伟达在全球市场的需求。

💡 主要观点

- 重塑 Transformer 关键部件是突破算力围墙的核心。 Kimi 系列通过将注意力、残差连接和优化器分别改为 KDA 混合线性、注意力残差、按头调节的 Muon,实现了显存占用和算力消耗的大幅下降。

MoE 混合专家模型与线性/稀疏注意力共同降低激活参数成本。 从 DeepSeek V3 的 6710 亿参数到 Kimi K3 的 2.8 万亿总参数,激活参数仅为总参数的约 4%,显著压缩了推理阶段的算力账单。
长上下文优化分为共享、压缩、按需读取和记忆改写四步。 通过 MQA/GQA 共享 KV、MLA 压缩、稀疏注意力按需读取以及线性注意力的固定维度矩阵,实现了单 token 显存从 320KB 降至约 13KB 的效果。
单 token 成本下降导致整体算力需求反而上升——杰文斯悖论在大模型领域的体现。 成本降低激发了更长上下文、更高并发和更大参数模型的需求,导致整体内存和存储需求继续增长,算力围墙仍在推动技术创新。
黄仁勋公开支持中国模型研发是为了扩大芯片生态而非单纯政治立场。 开放权重让更多开发者和企业使用英伟达卡,提升芯片销量;与此同时,英伟达也在关注自研芯片的竞争格局。

💬 文章金句

- token 效率不只是效率问题,它实际上也在抬高智能的上限。

  • 我们的定价不是朝一个非常便宜的价格去定的,也想告诉全世界,开源模型,包括中国模型,不是低价标签。
  • 算力围墙拦得住芯片、设备、内存颗粒,却拦不住模型架构设计。

📊 文章信息

AI 初评:88

来源:腾讯科技

作者:腾讯科技

分类:人工智能

语言:中文

阅读时间:28 分钟

字数:6857

标签: 大模型, 模型架构, 算力围墙, 混合专家模型, 长上下文优化

阅读完整文章

查看原文 → 發佈: 2026-07-28 18:35:00 收錄: 2026-07-29 02:00:58

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。