← 回總覽

一文读懂 Kimi K3 预训练|3T 模型,不再是魔法

📅 2026-07-30 14:06 腾讯科技 人工智能 2 分鐘 2213 字 評分: 93
大模型 MoE 线性注意力 LatentMoE 训练优化
📌 一句话摘要 本文深入解析 Kimi K3 3T 参数模型的训练技术路径,涵盖 MoE、线性注意力、LatentMoE、并行优化及残差改造等关键创新。 📝 详细摘要 文章详细拆解了 Kimi K3 这一 2.78 万亿参数、激活约 1042 亿参数的 MoE 大模型在预训练阶段的关键技术。它首先说明了模型规模扩展的瓶颈不在于能否装下参数,而在于算力效率、通信开销和训练稳定性。接着逐层介绍了 K3 的核心创新:使用线性注意力(KDA)结合 3:1 混合 MLA 将全局注意力的 O(N²) 复杂度降至 O(N),并通过输出门、遗忘门及 Delta Rule 提升长上下文信息保留;采用 Lat

📌 一句话摘要

本文深入解析 Kimi K3 3T 参数模型的训练技术路径,涵盖 MoE、线性注意力、LatentMoE、并行优化及残差改造等关键创新。

📝 详细摘要

文章详细拆解了 Kimi K3 这一 2.78 万亿参数、激活约 1042 亿参数的 MoE 大模型在预训练阶段的关键技术。它首先说明了模型规模扩展的瓶颈不在于能否装下参数,而在于算力效率、通信开销和训练稳定性。接着逐层介绍了 K3 的核心创新:使用线性注意力(KDA)结合 3:1 混合 MLA 将全局注意力的 O(N²) 复杂度降至 O(N),并通过输出门、遗忘门及 Delta Rule 提升长上下文信息保留;采用 LatentMoE 将专家参数压缩至半宽,使专家数量翻倍后通信量不变;通过上下文并行(KDA Context Parallelism)、量化负载均衡(Quantile Balancing)、微批次专家复制(MoonEP)以及负载感知调度器实现跨 GPU 通信与专家负载的均衡;最后引入 Attention Residual(AttnRes)以及 RMSNorm、SiTU‑GLU、Per‑Head Muon 等数值稳定技术,解决深层残差信息稀释问题,显著提升每单位 FLOPs 的学习回报,使模型实现约 2.5 倍的规模扩展效率。全文结构清晰、图文并茂,兼具理论深度与工程细节,适合技术研发人员深度理解千亿级 MoE 模型的训练要领。

💡 主要观点

- K3 采用混合专家(MoE)并将激活专家数从 8 增至 16,通过 LatentMoE 将专家参数压缩至半宽,保持通信量不变,实现参数规模扩展而不导致通信爆炸。 LatentMoE 先用下投影把 7168 维特征压缩到 3584 维潜在空间,16 个路由专家只处理这半宽表示,汇总后再投影回原始维度,从而在专家数量翻倍时总通信开销保持不变。

线性注意力(KDA)结合 3:1 混合 MLA,将全局注意力的 O(N²) 复杂度降至 O(N),并通过输出门、遗忘门及 Delta Rule 提升长上下文信息保留与检索精度。 KDA 用固定大小状态向量累积历史信息,实现线性计算;输出门像调音台一样筛选有用特征;Delta Rule 通过增量纠错让线性注意力记得更准;每三层 KDA 插入一层 MLA 恢复部分全局细节,兼顾效率与精度。
通过上下文并行(KDA Context Parallelism)、量化负载均衡(Quantile Balancing)、微批次专家复制(MoonEP)以及负载感知调度器,实现跨 GPU 通信与专家负载的均衡,显著提升硬件利用率和训练吞吐。 上下文并行让每块 GPU 只交换固定大小的状态摘要;Quantile Balancing 根据全局批次路由分布动态调节专家阈值;MoonEP 在微批级别检测并复制热门专家以缓解局部堵塞;负载感知调度器根据实时专家负载分配计算资源,共同消除通信瓶颈和负载不均。
引入 Attention Residual(AttnRes)以及 RMSNorm、SiTU‑GLU、Per‑Head Muon 等数值稳定技术,解决深层残差信息稀释问题,提升每单位 FLOPs 的学习回报,使 2.8T 参数模型实现约 2.5 倍的规模扩展效率。 AttnRes 让深层网络通过注意力机制选择性重用浅层特征,避免传统残差的信息累加稀释;RMSNorm 和 SiTU‑GLU 防止激活函数限制异常值;Per‑Head Muon 让各注意力头独立更新,防止梯度主导,整体提升数值稳定性和训练效率。

💬 文章金句

- 线性注意力的核心目标,它不再保留全部历史,而是把读过的内容不断压进一个固定大小的状态矩阵。

  • KDA 完成修改后并不直接把 token 送到后面的神经网络中,这里还有一道输出门。它负责决定候选信息里的哪些特征可以进入下一层。
  • LatentMoE 通过一次下投影把 Token 从 7168 维压缩到 3584 维潜在空间,16 个路由专家只处理这份半宽表示,结果汇总后再投影回 7168 维。
  • AttnRes 则把不同层产生的表示视为一组候选信息。模型进入新一层时,会根据当前状态生成查询,再通过注意力计算判断,此刻更需要浅层保存的局部特征、中层形成的结构信息,还是最近几层产生的高阶语义。

📊 文章信息

AI 初评:93

来源:腾讯科技

作者:腾讯科技

分类:人工智能

语言:中文

阅读时间:47 分钟

字数:11546

标签: 大模型, MoE, 线性注意力, LatentMoE, 训练优化

阅读完整文章

查看原文 → 發佈: 2026-07-30 14:06:00 收錄: 2026-07-30 18:00:36

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。