Architecture note
如何理解这颗芯片
B200 是 Blackwell 数据中心 GPU 的主力形态。它把两个接近光刻掩模极限的计算裸片封装为单一逻辑 GPU,并以 HBM3e 支撑低精度 Tensor Core。
对 LLM decode,带宽常比峰值算力更重要。180 GB 容量决定单卡可驻留的模型与 KV Cache 规模,约 8 TB/s 则限定权重流经计算阵列的速度。
主要存储瓶颈
FP4 计算吞吐增长显著快于 HBM 带宽,decode 与小 batch 场景的算术强度偏低。