Architecture note
如何理解这颗芯片
TPU 8t 是第八代 TPU 的训练版本,重点是把单芯片 12.6 PFLOPS FP4、216 GB HBM 与大规模 3D Torus 网络组织为一个可编程训练系统。
Google 同时保留 128 MB VMEM 与 SparseCore,并通过 TPUDirect RDMA/Storage 缩短主机、存储与加速器之间的数据路径。
主要存储瓶颈
超大规模训练时,HBM 容量之外的关键约束是 all-reduce、检查点和稀疏专家通信。