FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
AMDGPU量产部署

CDNA 4 · 2025

Instinct MI355X

以 288 GB HBM3e、256 MB Infinity Cache 与 3D Chiplet 争取更大的单卡模型驻留空间。

2 个官方来源可信度 核验 2026-09-04

Memory thesis

8 × HBM3e + 256 MB Infinity Cache + 分布式 L2

MI355X 选择“容量优先 + 大内存侧缓存”,适合大模型驻留,但性能工程必须理解 Chiplet 局部性。

工艺 / 封装
TSMC 3 nm / 6 nm · 3D Chiplet
存储
288 GB HBM3e
存储带宽
8 TB/s
峰值计算
10.1 PFLOPS MXFP4 Dense
功耗
1,400 W TBP
互联
Infinity Fabric · 1.075 TB/s

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

LDS

CU 级 scratchpad

每 CU 160 KB,由 wavefront 与 kernel 显式管理。

02

L2

XCD 本地缓存

分布在八个计算裸片上,优先承接本地复用。

03

Infinity Cache

内存侧共享缓存

256 MB,位于 I/O Die,缓冲跨 XCD 与 HBM 流量。

04

HBM3e

统一显存

288 GB、8 TB/s,容量是其 LLM 部署竞争力核心。

Architecture note

如何理解这颗芯片

MI355X 是 CDNA 4 高功耗液冷版本,保留 MI300 系列的多 XCD、多 I/O Die 组织,同时强化低精度格式与内存容量。

八组 HBM3e 堆栈与 256 MB Infinity Cache 构成三级全局存储层次。对软件而言它仍表现为大容量统一 GPU,但跨裸片访问路径会影响尾延迟和有效缓存带宽。

主要存储瓶颈

统一地址空间掩盖了物理 NUMA 特征;跨 I/O Die 的远端访问可能降低 Infinity Cache 与 HBM 的有效带宽。

Evidence

资料入口