FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
AMDGPUH2 2026 量产

MI400 · CDNA 5 · 2026

Instinct MI455X

12 栈 HBM4 与 3D 混合键合计算裸片把 MI400 推向 72-GPU Helios 机架级系统。

2 个官方来源可信度 核验 2026-09-04

Memory thesis

12-stack HBM4 + 3D bonded compute + Infinity Fabric

MI455X 的竞争力必须按 Helios 系统评估:HBM4 数字很强,实际收益取决于 scale-up 网络和 ROCm 全栈。

工艺 / 封装
CDNA 5 · 3D Hybrid Bonding · CoWoS-L
存储
432 GB HBM4 · 12 stacks
存储带宽
23.3 TB/s
峰值计算
40 PFLOPS FP4 · 20 PFLOPS FP8
功耗
机架级液冷
互联
Infinity Fabric · 3.6 TB/s scale-up

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

LDS / Cache

CU 局部复用

服务矩阵指令、wavefront 与高复用 tile。

02

HBM4

模型与训练状态主存

432 GB、23.3 TB/s,以 12 栈封装提高容量和带宽密度。

03

Infinity Fabric

多 GPU scale-up

单 GPU 3.6 TB/s,连接 Helios 内的 72 颗加速器。

04

Host / Fabric

数据与容量扩展

与 EPYC、以太网和存储共同组成机架级训练/推理路径。

Architecture note

如何理解这颗芯片

MI455X 是 AMD MI400 系列的通用 AI 旗舰,采用 CDNA 5 与 3D hybrid bonding。单颗拥有 432 GB HBM4 和 23.3 TB/s 带宽,显著提高大模型状态的本地驻留比例。

AMD 将它放进 72-GPU Helios 机架中,scale-up 互联与 HBM4 共同形成系统内存域;因此应同时观察单卡规格、整柜拓扑和 ROCm 软件成熟度。

主要存储瓶颈

12 栈 HBM4 缓解容量与带宽,但 72-GPU 系统的 collective、功耗和软件调度成为主要约束。

Evidence

资料入口