FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
AMDGPU量产部署

CDNA 3 · 2023

Instinct MI300X

八个计算裸片在四个 I/O Die 上方工作,以统一地址空间呈现 192 GB HBM3。

1 个官方来源可信度 核验 2026-09-04

Memory thesis

HBM3 + 256 MB Infinity Cache + Chiplet 统一地址空间

MI300X 是研究“统一编程模型与物理非统一内存”张力的代表性 Chiplet GPU。

工艺 / 封装
TSMC 5 nm / 6 nm · 3D Chiplet
存储
192 GB HBM3
存储带宽
5.3 TB/s
峰值计算
2.61 PFLOPS FP8 Dense
功耗
750 W TBP
互联
Infinity Fabric · PCIe 5.0

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

LDS / L1

CU 本地复用

显式 scratchpad 与一级缓存减少全局数据搬移。

02

L2

XCD 本地缓存

每个计算裸片独立,访问局部性影响延迟。

03

Infinity Cache

内存侧缓存

总计 256 MB,分布在四个 I/O Die。

04

HBM3

加速器主存

8 堆栈、192 GB、5.3 TB/s。

Architecture note

如何理解这颗芯片

MI300X 把 AMD 在 CPU 上成熟的 Chiplet 思路推向大计算 GPU。八个 XCD 通过 Infinity Fabric 访问四个 I/O Die 上的缓存与 HBM 控制器。

它的突出点不是单一峰值,而是 192 GB HBM3 与 256 MB Infinity Cache 的组合,让更多大模型能在单卡或较少卡数上驻留。

主要存储瓶颈

当访问均匀条带化到所有内存控制器时,跨 Die 流量可能先碰到 die-to-die 带宽,而非 HBM 理论上限。

Evidence

资料入口