← 回總覽

灵骏真武 M890 超节点实例 Day0 适配 Kimi K3

📅 2026-07-28 18:18 阿里技术 人工智能 2 分鐘 1699 字 評分: 87
大模型 MoE 架构 推理优化 芯片适配 MXFP4
📌 一句话摘要 阿里云灵骏真武 M890 超节点成功适配 2.8 万亿参数 Kimi K3,通过芯片、平台和模型联合优化,首 Token 时延降低约 35%。 📝 详细摘要 文章介绍阿里云灵骏真武 M890 超节点实例在 Day0 阶段完成对月之暗面 Kimi K3(2.8 万亿参数、MoE 架构)大模型的适配。依托真武 M890 芯片的高速芯片、ICN Switch 1.0 互联及 T-Head SAIL 软件栈,三方在算子层、通信层和精度层展开三项重点优化:EP 专家并行通信优化、MXFP4 混合精度推理以及 KDA 混合架构算子深度优化。实测显示,首 Token 时延下降约 35%,

📌 一句话摘要

阿里云灵骏真武 M890 超节点成功适配 2.8 万亿参数 Kimi K3,通过芯片、平台和模型联合优化,首 Token 时延降低约 35%。

📝 详细摘要

文章介绍阿里云灵骏真武 M890 超节点实例在 Day0 阶段完成对月之暗面 Kimi K3(2.8 万亿参数、MoE 架构)大模型的适配。依托真武 M890 芯片的高速芯片、ICN Switch 1.0 互联及 T-Head SAIL 软件栈,三方在算子层、通信层和精度层展开三项重点优化:EP 专家并行通信优化、MXFP4 混合精度推理以及 KDA 混合架构算子深度优化。实测显示,首 Token 时延下降约 35%,单卡解码吞吐提升约 1.8 倍,且得益于 KDA 线性注意力的近线性开销,可稳定支持最长 1M 上下文。文章强调这是芯片、推理框架与云平台全栈协同的成果,为万亿参数模型提供了国内可获取的高算力选择,并指出未来将继续深化合作以提升性能与性价比。

💡 主要观点

- 灵骏真武 M890 超节点实现 Kimi K3 Day0 平稳运行。 通过芯片、推理平台和模型的联合适配,阿里云、平头哥与 Kimi 团队使 2.8 万亿参数的 Kimi K3 在超节点上首次成功跑通,为后续性能优化奠定基础。

首 Token 时延降低约 35%,解码吞吐提升约 1.8 倍。 实测数据表明,超节点在运行 Kimi K3 时,TTFT(首 Token 时延)显著下降,单卡解码吞吐提升,长上下文场景体感更流畅。
三项核心优化:EP 通信、MXFP4 精度、KDA 算子。 分别通过 ICN64 高带宽通信域优化 All-to-All 专家流量、使用 MXFP4 低精度提升计算密度、以及对 KDA 线性注意力算子进行融合与访存优化,共同降低延迟与提升吞吐。
近线性开销支持最长 1M 上下文。 得益于 KDA 混合架构的线性注意力特性,算力开销随序列长度近线性增长,使模型能够稳定处理超长文档和复杂推理任务。
全栈协同为万亿参数模型提供国内高算力选择。 阿里云、平头哥与 Kimi 团队从芯片到云平台的深度合作,不仅实现了 Day0 适配,还为后续性能调优和工程化部署奠定合作基础。

💬 文章金句

- 灵骏真武 M890 超节点实例已成功适配 2.8 万亿参数大模型 Kimi K3,基于芯片、推理平台和模型的联合优化,有效提升模型推理效率。

  • 实测结果显示,该超节点运行 Kimi K3 的首 Token 时延降低约 35%,长上下文场景下用户体验更流畅。
  • 借助 ICN64 高带宽通信域对 MoE 最核心的 All-to-All 专家路由通信进行深度调优,将 2.8 万亿参数的专家并行流量完整承载在单一超节点内部,避免跨节点通信成为瓶颈。
  • 结合真武 M890 原生支持的 MXFP4 低精度算力,在保证模型效果无损的前提下,大幅提升计算密度与显存利用效率。
  • 得益于 KDA 线性注意力混合架构与算子优化,长序列推理算力开销随长度近线性增长,稳定支持最长 1M 上下文。

📊 文章信息

AI 初评:87

来源:阿里技术

作者:阿里技术

分类:人工智能

语言:中文

阅读时间:6 分钟

字数:1395

标签: 大模型, MoE 架构, 推理优化, 芯片适配, MXFP4

阅读完整文章

查看原文 → 發佈: 2026-07-28 18:18:00 收錄: 2026-07-28 22:00:58

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。