Architecture note
如何理解这颗芯片
TPU 8i 是 Google 第八代 TPU 中面向推理与 reasoning 的版本。相比训练型 8t,它用 288 GB HBM 与 384 MB 片上 VMEM换取更大的模型和 KV Cache 驻留空间。
Boardfly 互联和 Collectives Acceleration Engine(CAE)面向集合通信优化;官方对照表把 LLM Decoder Engine 列在 TPU 8t,而非 TPU 8i。
主要存储瓶颈
推理瓶颈从单芯片 HBM 带宽延伸到大规模 collective、KV Cache 容量与多租户调度。