← 回總覽

2 纳米 GPU,AMD 的划时代设计

📅 2026-07-26 09:42 半导体行业观察 人工智能 2 分鐘 2181 字 評分: 87
GPU架构 AI加速器 半导体 CDNA5 AMD
📌 一句话摘要 文章深度解析 AMD 全新 Instinct MI455X GPU 架构,详细说明其基于 CDNA5 的计算单元、内存带宽、机架级扩展及对 GCN 架构的历史性过渡。 📝 详细摘要 文章介绍了 AMD 首款专为机架级 AI 部署设计的 GPU——Instinct MI455X,基于全新 CDNA5 架构。文章详细阐述了其计算单元从 CU 转为 WGP、SIMD 宽度翻倍、VGPR 寄存器文件扩容、矩阵单元提升以及 L1/LDS 缓存加倍等硬件改进。随后给出了具体性能指标:峰值 FP32 计算达 315 TFLOP,OCP MXFP4 达 40.26 PFLOP,配备 12

📌 一句话摘要

文章深度解析 AMD 全新 Instinct MI455X GPU 架构,详细说明其基于 CDNA5 的计算单元、内存带宽、机架级扩展及对 GCN 架构的历史性过渡。

📝 详细摘要

文章介绍了 AMD 首款专为机架级 AI 部署设计的 GPU——Instinct MI455X,基于全新 CDNA5 架构。文章详细阐述了其计算单元从 CU 转为 WGP、SIMD 宽度翻倍、VGPR 寄存器文件扩容、矩阵单元提升以及 L1/LDS 缓存加倍等硬件改进。随后给出了具体性能指标:峰值 FP32 计算达 315 TFLOP,OCP MXFP4 达 40.26 PFLOP,配备 12 堆 HBM4 显存共 432 GB,带宽 23.3 TB/s。文中还描述了 Helios 机架方案(单机架 72 GPU、UALink 以太网互连、3.6 TB/s 单 GPU 带宽)、广播仲裁器与多播加载带宽放大机制、L2 缓存带宽提升至 54 TB/s 以及基于 RDNA 系列微架构的过渡,标志着 GCN 架构的终结。文章来源于半导体行业观察,内容为对 chipsandcheese 的编译翻译,兼具技术深度与系统性解读。

💡 主要观点

- 计算单元从 CU 演进为 WGP,SIMD 宽度从 16 翻至 32 CDNA5 中每个 WGP 包含四个双发射 Wave32 SIMD32 单元,使每个波前每周期可执行 256 次打包 FP32 操作(FMA 下达 512 FLOPS),显著提升并行计算能力。

峰值计算性能与内存带宽大幅提升 单颗 MI455X 峰值 FP32 达 315 TFLOP,OCP MXFP4 达 40.26 PFLOP;配备 12 堆 HBM4 显存,总容量 432 GB,读写带宽 23.3 TB/s,为大规模 AI 模型提供充足算力与内存资源。
Helios 机架级扩展方案实现 72 GPU 互联 Helios 机架采用 OCP 开放式宽型设计,单机架容纳 72 块 MI455X,每块 GPU 通过 36 条 400Gbit/s UALoE 链路实现 3.6 TB/s 双向带宽,支持横向与纵向扩展,构建高带宽低延迟的 AI 基础设施。
广播仲裁器与多播加载带来有效带宽放大 新架构中的广播仲裁器取代 L1 缓冲区,可将单条 L2 流量转为四个本地传输,实现最高 4 倍带宽放大;多播加载使共享数据仅需一次从 L2 读取,随后广播至所有相关 WGP 私有 LDS,显著降低冗余内存流量。

💬 文章金句

- AMD 全新的 Instinct MI455X 将取代之前的 Instinct MI355X,成为 AMD AI 产品线的旗舰产品。这是 AMD 首款专为机架级 AI 部署而设计的 GPU,基于全新的 CDNA5 架构,其计算单元和 SoC 均进行了重大改进,包括提升计算性能、提高内存带宽、扩大内存容量,并采用台积电的 CoWoS-L 封装。

  • 单个 MI455X 包含 256 个工作组处理器 (WGP),分布在 8 个加速器复合体芯片 (XCD) 上,最高"引擎"时钟频率为 2.4GHz。这使其峰值计算性能达到 315 TFLOP(矩阵/向量 FP32 和向量 FP16),以及高达 40.26 PFLOP(OCP MXFP4)。此外,它还配备 12 个 HBM4 显存堆栈,每个堆栈位于 2048 位总线上,总共 192 个通道,使每个 GPU 拥有 432 GB 的显存容量,读写速度为 23.3 TB/秒。
  • 为了支持这种新的 SIMD 设计,VGPR 寄存器文件经过重新组织,现在每个波前最多可以寻址 1024 个 VGPR,是之前 CDNA 和 RDNA 架构中单个波前可访问 VGPR 数量的四倍。
  • AMD 将此称为高达 4 倍的带宽放大,但放大发生在 L2 缓存之后,并非 L2 或 HBM 带宽翻四倍。相反,一个 L2 流量单位被转换为四个本地传输的数据单位,从而减少了冗余缓存读取和芯片间链路流量,同时确保每个 WGP 都拥有数据的近端副本。
  • 随着 CDNA5 的发布,AMD 转向了基于 RDNA 系列的微架构,这也标志着 GCN 微架构漫长历史的终结。

📊 文章信息

AI 初评:87

来源:半导体行业观察

作者:半导体行业观察

分类:人工智能

语言:中文

阅读时间:12 分钟

字数:2913

标签: GPU架构, AI加速器, 半导体, CDNA5, AMD

阅读完整文章

查看原文 → 發佈: 2026-07-26 09:42:00 收錄: 2026-07-26 22:00:04

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。