1. 模型规模:总参数很大,激活参数相对可控
Kimi K3 的主要规模参数包括:
* 总参数量约2.8T
* 单次推理激活参数约104B
* 采用超稀疏 MoE 架构
* 包含大量路由专家,每个 Token 只激活其中少量专家
* 支持约100 万 Token的上下文
* 集成视觉编码器,支持原生多模态输入
这种设计的核心目标是同时获得:
- 超大参数规模带来的知识容量;
- 稀疏激活带来的计算效率;
- 百万上下文带来的长文档和长任务处理能力。
2. 核心架构创新
2.1 KDA 与 Gated MLA:服务超长上下文
传统 Transformer 在上下文不断增长时,需要保存越来越大的 KV Cache,推理成本会随序列长度上升。
Kimi K3 采用 KDA 与 MLA 结合的混合结构:
* KDA使用固定大小的递归状态处理序列,降低长上下文带来的缓存压力;
* MLA周期性提供高容量的全局注意力,弥补纯线性或递归结构可能出现的信息损失;
* 两者结合,兼顾长序列效率和全局信息提取能力。
可以把它理解为:
> KDA 负责高效地沿着长序列持续读取,MLA 负责定期进行更全面的信息整合。
2.2 Attention Residuals:改善深层模型的信息传递
普通 Transformer 主要逐层传递隐藏状态。模型层数很深时,早期信息可能在多次变换中逐渐减弱。
Attention Residuals 允许当前层动态读取前面不同层的表示,而不仅是依赖紧邻的上一层。
这相当于为深层网络增加了一套“跨层注意力”机制,使模型可以按需要重新调用:
* 原始输入表示;
* 中间层特征;
* 高层抽象信息。
它主要解决的是超深模型中的信息衰减和优化困难问题。
2.3 Stable LatentMoE:扩大专家数量并保持稳定
Kimi K3 使用超稀疏 MoE 扩大模型容量,但大量专家会增加训练不稳定、负载不均衡和通信成本。
Stable LatentMoE 的思路是先把表示映射到更紧凑的 latent 空间,再进入专家网络,从而:
* 降低专家计算和通信压力;
* 支持更多专家;
* 改善训练稳定性;
* 提高模型容量与实际计算量之间的比例。
3. 百万上下文:不是直接把长度拉到 100 万
Kimi K3 采用渐进式的上下文扩展训练,大致按照以下阶段推进:
8K → 64K → 256K → 1M
这样做可以避免模型在训练早期直接面对超长序列,降低训练不稳定和成本过高的问题。
除了扩大窗口,团队还构造了需要从长上下文不同位置查找和整合信息的合成任务。
这一点很重要,因为:
> 模型能够接收 100 万 Token,不代表它真的能够有效利用 100 万 Token。
真正有价值的是模型能否在超长文档中完成跨段落检索、信息关联、证据整合和长期状态保持。
4. 原生多模态训练
Kimi K3 在预训练阶段就联合处理文本和视觉数据,而不是先训练纯语言模型,再额外挂接视觉模块。
这种原生多模态路线有助于让模型更早建立文本与图像之间的统一表示,适合处理:
* 图文混合文档;
* 网页和应用界面;
* 图表与截图;
* 多模态 Agent 任务。
这也说明 Kimi K3 的目标不只是聊天或文本推理,而是面向真实软件环境和复杂工作流。
5. 后训练:先训练领域专家,再合并成统一模型
Kimi K3 的后训练流程可以概括为:
SFT 冷启动 ↓不同领域的强化学习 ↓多个教师策略 ↓在线蒸馏为统一模型
强化学习大致覆盖三类方向:
* 通用推理任务;
* 通用 Agent 任务;
* Coding Agent 任务。
不同领域还会训练不同推理强度的策略,例如较低、较高和最大推理预算,由此形成多个专家策略。
最后再通过多教师在线蒸馏,把这些不同能力合并回一个统一模型。
这种方案试图解决一个常见问题:
> 一个模型同时学习数学、编程、工具调用和长程 Agent 任务时,不同目标之间容易互相干扰。
先分领域强化,再统一蒸馏,可以让各个专家先充分学习,最后再进行能力融合。
6. Agent 能力是报告重点
Kimi K3 的训练目标并不只是提高单轮问答能力,而是让模型学会持续执行:
理解任务→ 制定计划→ 调用工具→ 观察结果→ 检查错误→ 修正方案→ 继续执行
因此,报告尤其强调 Coding Agent、工具调用、浏览器操作和终端任务。
这说明 Kimi K3 的定位已经从传统大语言模型进一步转向:
> 能够在真实环境中连续工作、调用工具并完成复杂目标的基础 Agent 模型。
7. 如何理解报告中的评测结果
报告显示,Kimi K3 在编程、工具调用和 Agent 类基准测试中表现突出,部分项目超过了多款闭源和开放模型。
但阅读这些结果时需要注意:
- 不同模型可能使用不同的 Agent Harness;
- 工具、提示词和测试环境会明显影响结果;
- 单项基准成绩不等于真实产品体验;
- 百万上下文窗口不等于百万上下文利用率;
- 部分成绩可能来自内部评测或第三方榜单,复现条件并不完全一致。
> Kimi K3 在 Coding 和 Agent 方向展现了很强的竞争力,但还不能只根据几项基准判断其综合能力已经全面领先。
8. “2.5 倍 Scaling Efficiency”应该怎样理解
报告中的 scaling efficiency,主要指模型达到相同验证损失时所需要的训练计算量更少。
它不能直接理解为:
* 推理速度提高 2.5 倍;
* API 成本降低 2.5 倍;
* 显存需求降低 2.5 倍;
* 实际任务效果提高 2.5 倍。
更准确的理解是:
> 新架构在训练规模扩展过程中,能够更加高效地把计算量转化为模型能力。
9. 总体评价
Kimi K3 最值得关注的是它组合了四条技术路线:
- 超稀疏 MoE:扩大模型容量;
- KDA 与 MLA 混合结构:支持百万级上下文;
- 原生多模态预训练:面向图文和真实软件环境;
- 大规模 Agent 强化学习:提高长程任务执行能力。
> 下一代基础模型不只是更大,还要同时具备更高容量、更长记忆、更强工具使用能力,以及持续完成复杂任务的能力。
从这个角度看,Kimi K3 更像是一套面向 Agent 时代重新设计的基础模型系统,而不仅是一款参数更大的语言模型。
以下是该技术报告英中对照版,感兴趣的朋友可以关注 AINLP 公众号回复 'kimik3' 获取该报告全文: