本文深入解析 Kimi K3 3T 参数模型的训练技术路径,涵盖 MoE、线性注意力、LatentMoE、并行优化及残差改造等关键创新。
📝 详细摘要
文章详细拆解了 Kimi K3 这一 2.78 万亿参数、激活约 1042 亿参数的 MoE 大模型在预训练阶段的关键技术。它首先说明了模型规模扩展的瓶颈不在于能否装下参数,而在于算力效率、通信开销和训练稳定性。接着逐层介绍了 K3 的核心创新:使用线性注意力(KDA)结合 3:1 混合 MLA 将全局注意力的 O(N²) 复杂度降至 O(N),并通过输出门、遗忘门及 Delta Rule 提升长上下文信息保留;采用 LatentMoE 将专家参数压缩至半宽,使专家数量翻倍后通信量不变;通过上下文并行(KDA Context Parallelism)、量化负载均衡(Quantile Balancing)、微批次专家复制(MoonEP)以及负载感知调度器实现跨 GPU 通信与专家负载的均衡;最后引入 Attention Residual(AttnRes)以及 RMSNorm、SiTU‑GLU、Per‑Head Muon 等数值稳定技术,解决深层残差信息稀释问题,显著提升每单位 FLOPs 的学习回报,使模型实现约 2.5 倍的规模扩展效率。全文结构清晰、图文并茂,兼具理论深度与工程细节,适合技术研发人员深度理解千亿级 MoE 模型的训练要领。
💡 主要观点
- K3 采用混合专家(MoE)并将激活专家数从 8 增至 16,通过 LatentMoE 将专家参数压缩至半宽,保持通信量不变,实现参数规模扩展而不导致通信爆炸。 LatentMoE 先用下投影把 7168 维特征压缩到 3584 维潜在空间,16 个路由专家只处理这半宽表示,汇总后再投影回原始维度,从而在专家数量翻倍时总通信开销保持不变。
💬 文章金句
- 线性注意力的核心目标,它不再保留全部历史,而是把读过的内容不断压进一个固定大小的状态矩阵。
- KDA 完成修改后并不直接把 token 送到后面的神经网络中,这里还有一道输出门。它负责决定候选信息里的哪些特征可以进入下一层。
- LatentMoE 通过一次下投影把 Token 从 7168 维压缩到 3584 维潜在空间,16 个路由专家只处理这份半宽表示,结果汇总后再投影回 7168 维。
- AttnRes 则把不同层产生的表示视为一组候选信息。模型进入新一层时,会根据当前状态生成查询,再通过注意力计算判断,此刻更需要浅层保存的局部特征、中层形成的结构信息,还是最近几层产生的高阶语义。
📊 文章信息
AI 初评:93
来源:腾讯科技
作者:腾讯科技
分类:人工智能
语言:中文
阅读时间:47 分钟
字数:11546
标签: 大模型, MoE, 线性注意力, LatentMoE, 训练优化