FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
NVIDIAGPU量产部署

Blackwell · 2024

Blackwell B200

Blackwell 以双裸片、HBM3e 和 NVLink 5 奠定“GPU 即系统节点”的主流范式。

1 个官方来源可信度 核验 2026-09-04

Memory thesis

HBM3e + L2 / Shared Memory + NVLink 统一扩展

B200 的价值在 HBM3e 与 NVLink 共同提供的“驻留 + 搬移”能力;单看 FP4 峰值会高估真实 token 吞吐。

工艺 / 封装
TSMC 4NP · 双裸片
存储
180 GB HBM3e
存储带宽
最高 8 TB/s
峰值计算
9 PFLOPS FP4 Dense
功耗
最高 1,000 W
互联
NVLink 5 · 900 GB/s

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

Registers / Shared Memory

显式数据复用

kernel 在 SM 内重排 tile,避免重复访问 HBM。

02

L2 Cache

全 GPU 共享缓存

为跨 SM、跨裸片访问提供缓存与一致地址空间。

03

HBM3e

加速器主存

180 GB 容量,官方平台资料给出最高约 8 TB/s。

04

NVLink 5

跨 GPU 数据域

配合 NVSwitch 构建 8 GPU HGX 与 72 GPU NVL 系统。

Architecture note

如何理解这颗芯片

B200 是 Blackwell 数据中心 GPU 的主力形态。它把两个接近光刻掩模极限的计算裸片封装为单一逻辑 GPU,并以 HBM3e 支撑低精度 Tensor Core。

对 LLM decode,带宽常比峰值算力更重要。180 GB 容量决定单卡可驻留的模型与 KV Cache 规模,约 8 TB/s 则限定权重流经计算阵列的速度。

主要存储瓶颈

FP4 计算吞吐增长显著快于 HBM 带宽,decode 与小 batch 场景的算术强度偏低。

Evidence

资料入口