FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
IntelASIC量产部署

Gaudi · 2024

Gaudi 3

以大片上 SRAM、HBM2e 和片上 200GbE 端口坚持开放以太网扩展路线。

1 个官方来源可信度 核验 2026-09-04

Memory thesis

96 MB SRAM + 128 GB HBM2e + 片上 RoCE

Gaudi 3 是观察“开放以太网能否替代专有 scale-up fabric”的清晰样本。

工艺 / 封装
TSMC 5 nm · 双裸片
存储
128 GB HBM2e + 96 MB SRAM
存储带宽
3.7 TB/s HBM · 12.8 TB/s SRAM
峰值计算
1.678 PFLOPS FP8 / BF16
功耗
900 W OAM
互联
24 × 200 GbE RoCE

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

TPC Local Memory

核心私有复用

供向量与通用张量操作就近访问。

02

Shared SRAM

片上交换与热点

总计 96 MB,聚合带宽约 12.8 TB/s。

03

HBM2e

模型主存

八堆栈、128 GB、3.7 TB/s。

04

Integrated RoCE

跨芯片扩展

24 × 200GbE,利用标准以太网组网。

Architecture note

如何理解这颗芯片

Gaudi 3 由两个对称裸片组成,包含 Matrix Math Engine、Tensor Processing Core 与共享 SRAM。它没有专用 NVLink 类交换域,而是把 24 个 200GbE RoCE 端口直接集成到芯片。

这种设计让内存层次和网络层次连成一体:96 MB SRAM 负责片上热点,128 GB HBM2e 承载模型,标准以太网处理 scale-up 与 scale-out。

主要存储瓶颈

HBM2e 容量和带宽落后于 HBM3e 新平台;优势更多取决于 SRAM 利用与以太网集群成本。

Evidence

资料入口