阿里云灵骏真武 M890 超节点成功适配 2.8 万亿参数 Kimi K3,通过芯片、平台和模型联合优化,首 Token 时延降低约 35%。
📝 详细摘要
文章介绍阿里云灵骏真武 M890 超节点实例在 Day0 阶段完成对月之暗面 Kimi K3(2.8 万亿参数、MoE 架构)大模型的适配。依托真武 M890 芯片的高速芯片、ICN Switch 1.0 互联及 T-Head SAIL 软件栈,三方在算子层、通信层和精度层展开三项重点优化:EP 专家并行通信优化、MXFP4 混合精度推理以及 KDA 混合架构算子深度优化。实测显示,首 Token 时延下降约 35%,单卡解码吞吐提升约 1.8 倍,且得益于 KDA 线性注意力的近线性开销,可稳定支持最长 1M 上下文。文章强调这是芯片、推理框架与云平台全栈协同的成果,为万亿参数模型提供了国内可获取的高算力选择,并指出未来将继续深化合作以提升性能与性价比。
💡 主要观点
- 灵骏真武 M890 超节点实现 Kimi K3 Day0 平稳运行。 通过芯片、推理平台和模型的联合适配,阿里云、平头哥与 Kimi 团队使 2.8 万亿参数的 Kimi K3 在超节点上首次成功跑通,为后续性能优化奠定基础。
💬 文章金句
- 灵骏真武 M890 超节点实例已成功适配 2.8 万亿参数大模型 Kimi K3,基于芯片、推理平台和模型的联合优化,有效提升模型推理效率。
- 实测结果显示,该超节点运行 Kimi K3 的首 Token 时延降低约 35%,长上下文场景下用户体验更流畅。
- 借助 ICN64 高带宽通信域对 MoE 最核心的 All-to-All 专家路由通信进行深度调优,将 2.8 万亿参数的专家并行流量完整承载在单一超节点内部,避免跨节点通信成为瓶颈。
- 结合真武 M890 原生支持的 MXFP4 低精度算力,在保证模型效果无损的前提下,大幅提升计算密度与显存利用效率。
- 得益于 KDA 线性注意力混合架构与算子优化,长序列推理算力开销随长度近线性增长,稳定支持最长 1M 上下文。
📊 文章信息
AI 初评:87
来源:阿里技术
作者:阿里技术
分类:人工智能
语言:中文
阅读时间:6 分钟
字数:1395
标签: 大模型, MoE 架构, 推理优化, 芯片适配, MXFP4