FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
GoogleASIC预览 / 导入

第八代 TPU · Training · 2026

TPU 8t

以 9,600 芯片 Superpod 和 3D Torus 扩展域服务下一代基础模型训练。

1 个官方来源可信度 核验 2026-09-14

Memory thesis

HBM + VMEM SRAM + 3D Torus 分布式内存域

8t 把存储系统边界扩大到 Superpod:性能取决于 HBM、TPUDirect 和拓扑感知编译的共同作用。

工艺 / 封装
Google 自研 TPU ASIC
存储
216 GB HBM + 128 MB VMEM
存储带宽
6.53 TB/s HBM
峰值计算
12.6 PFLOPS FP4
功耗
未披露
互联
3D Torus · 9,600-chip Superpod

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

VMEM

片上数据复用

128 MB SRAM,承接矩阵计算附近的热工作集。

02

HBM

训练权重、优化器与激活

216 GB、6,528 GB/s,为单芯片训练算子提供主带宽。

03

TPUDirect

主机与存储直达

RDMA 与 Storage 路径降低检查点、数据加载及跨节点搬运开销。

04

Superpod

跨芯片模型状态

3D Torus 最多连接 9,600 颗芯片,承接张量、流水与数据并行通信。

Architecture note

如何理解这颗芯片

TPU 8t 是第八代 TPU 的训练版本,重点是把单芯片 12.6 PFLOPS FP4、216 GB HBM 与大规模 3D Torus 网络组织为一个可编程训练系统。

Google 同时保留 128 MB VMEM 与 SparseCore,并通过 TPUDirect RDMA/Storage 缩短主机、存储与加速器之间的数据路径。

主要存储瓶颈

超大规模训练时,HBM 容量之外的关键约束是 all-reduce、检查点和稀疏专家通信。

Evidence

资料入口