FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
GoogleASICGoogle Cloud 可用

7th Gen TPU · 2025

TPU7x · Ironwood

两个各自拥有 96 GB HBM 的计算 Chiplet,通过高速 D2D 与 3D Torus 扩展到 9,216 芯片。

1 个官方来源可信度 核验 2026-09-04

Memory thesis

VMEM scratchpad + 192 GiB HBM + Host offload

Ironwood 展示了“编译器可见 NUMA”:硬件降低制造风险,软件承担更精细的布局与通信优化。

工艺 / 封装
双 Chiplet 定制 Tensor ASIC
存储
192 GiB HBM / 芯片
存储带宽
7.38 TB/s / 芯片
峰值计算
4.614 PFLOPS FP8
功耗
未公开
互联
ICI 1.2 TB/s · 3D Torus

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

VMEM

TensorCore 本地 scratchpad

容量可调,Pallas kernel 的 block size 常受其约束。

02

HBM per Chiplet

权重与激活主存

每个 Chiplet 96 GB;一颗 TPU 合计 192 GiB、约 7.38 TB/s。

03

D2D

Chiplet 间数据交换

官方称其比一条 1D ICI 链路快六倍。

04

Host Memory

压力缓解与卸载

通过 PCIe 卸载激活或优化器状态,但带宽明显低于 HBM。

Architecture note

如何理解这颗芯片

Ironwood 将单芯片划分为两个独立内存空间的 Chiplet,每个 Chiplet 含一个 TensorCore、两个 SparseCore 和 96 GB HBM。框架会看到两个设备,而不是完全隐藏物理边界。

这种设计把内存局部性显式交给 XLA、JAX 与 Pallas。高效运行不仅取决于 HBM,还取决于 VMEM 分块、D2D collectives 与 Pod 级切分。

主要存储瓶颈

双 Chiplet 的独立内存空间要求编译器与程序显式考虑分片;低效向量访问即使在 7.38 TB/s HBM 下仍会受限。

Evidence

资料入口