文章深度解析 AMD 全新 Instinct MI455X GPU 架构,详细说明其基于 CDNA5 的计算单元、内存带宽、机架级扩展及对 GCN 架构的历史性过渡。
📝 详细摘要
文章介绍了 AMD 首款专为机架级 AI 部署设计的 GPU——Instinct MI455X,基于全新 CDNA5 架构。文章详细阐述了其计算单元从 CU 转为 WGP、SIMD 宽度翻倍、VGPR 寄存器文件扩容、矩阵单元提升以及 L1/LDS 缓存加倍等硬件改进。随后给出了具体性能指标:峰值 FP32 计算达 315 TFLOP,OCP MXFP4 达 40.26 PFLOP,配备 12 堆 HBM4 显存共 432 GB,带宽 23.3 TB/s。文中还描述了 Helios 机架方案(单机架 72 GPU、UALink 以太网互连、3.6 TB/s 单 GPU 带宽)、广播仲裁器与多播加载带宽放大机制、L2 缓存带宽提升至 54 TB/s 以及基于 RDNA 系列微架构的过渡,标志着 GCN 架构的终结。文章来源于半导体行业观察,内容为对 chipsandcheese 的编译翻译,兼具技术深度与系统性解读。
💡 主要观点
- 计算单元从 CU 演进为 WGP,SIMD 宽度从 16 翻至 32 CDNA5 中每个 WGP 包含四个双发射 Wave32 SIMD32 单元,使每个波前每周期可执行 256 次打包 FP32 操作(FMA 下达 512 FLOPS),显著提升并行计算能力。
💬 文章金句
- AMD 全新的 Instinct MI455X 将取代之前的 Instinct MI355X,成为 AMD AI 产品线的旗舰产品。这是 AMD 首款专为机架级 AI 部署而设计的 GPU,基于全新的 CDNA5 架构,其计算单元和 SoC 均进行了重大改进,包括提升计算性能、提高内存带宽、扩大内存容量,并采用台积电的 CoWoS-L 封装。
- 单个 MI455X 包含 256 个工作组处理器 (WGP),分布在 8 个加速器复合体芯片 (XCD) 上,最高"引擎"时钟频率为 2.4GHz。这使其峰值计算性能达到 315 TFLOP(矩阵/向量 FP32 和向量 FP16),以及高达 40.26 PFLOP(OCP MXFP4)。此外,它还配备 12 个 HBM4 显存堆栈,每个堆栈位于 2048 位总线上,总共 192 个通道,使每个 GPU 拥有 432 GB 的显存容量,读写速度为 23.3 TB/秒。
- 为了支持这种新的 SIMD 设计,VGPR 寄存器文件经过重新组织,现在每个波前最多可以寻址 1024 个 VGPR,是之前 CDNA 和 RDNA 架构中单个波前可访问 VGPR 数量的四倍。
- AMD 将此称为高达 4 倍的带宽放大,但放大发生在 L2 缓存之后,并非 L2 或 HBM 带宽翻四倍。相反,一个 L2 流量单位被转换为四个本地传输的数据单位,从而减少了冗余缓存读取和芯片间链路流量,同时确保每个 WGP 都拥有数据的近端副本。
- 随着 CDNA5 的发布,AMD 转向了基于 RDNA 系列的微架构,这也标志着 GCN 微架构漫长历史的终结。
📊 文章信息
AI 初评:87
来源:半导体行业观察
作者:半导体行业观察
分类:人工智能
语言:中文
阅读时间:12 分钟
字数:2913
标签: GPU架构, AI加速器, 半导体, CDNA5, AMD