FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
GoogleASIC预览 / 导入

第八代 TPU · Inference · 2026

TPU 8i

用更大的 HBM 与片上 VMEM,加上 Boardfly 拓扑,专门优化大模型推理的访存与扩展效率。

2 个官方来源可信度 核验 2026-09-14

Memory thesis

HBM + VMEM SRAM + 集合通信加速

8i 的核心不是追求最高训练 FLOPS,而是通过更大 HBM、VMEM 和专用 collective 机制提高实际 token 吞吐。

工艺 / 封装
Google 自研 TPU ASIC
存储
288 GB HBM + 384 MB VMEM
存储带宽
8.6 TB/s HBM
峰值计算
10.1 PFLOPS FP4
功耗
未披露
互联
Boardfly · 最高 1,152 芯片域

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

Vector / Matrix Local Storage

计算单元局部复用

由 XLA 与内核调度管理中间数据,降低重复访问主存。

02

VMEM

片上工作集

384 MB SRAM,为推理中的热权重、激活和查表数据提供高复用层。

03

HBM

模型与 KV Cache 主存

288 GB、8,601 GB/s,容量和带宽均针对长上下文 serving。

04

Boardfly Fabric

跨芯片扩展域

面向大规模 collective 与 MoE token 交换,系统上限可达 1,152 颗物理芯片;官方同时描述 1,024 active chips,不能把物理规模直接当作可用规模。

Architecture note

如何理解这颗芯片

TPU 8i 是 Google 第八代 TPU 中面向推理与 reasoning 的版本。相比训练型 8t,它用 288 GB HBM 与 384 MB 片上 VMEM换取更大的模型和 KV Cache 驻留空间。

Boardfly 互联和 Collectives Acceleration Engine(CAE)面向集合通信优化;官方对照表把 LLM Decoder Engine 列在 TPU 8t,而非 TPU 8i。

主要存储瓶颈

推理瓶颈从单芯片 HBM 带宽延伸到大规模 collective、KV Cache 容量与多租户调度。

Evidence

资料入口