FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
AWSASICEC2 可用

Trn2 · 2024

Trainium2

从单芯片 HBM3 到 64 芯片 UltraServer,以无交换 point-to-point NeuronLink 形成云内 scale-up。

1 个官方来源可信度 核验 2026-09-04

Memory thesis

HBM3 + NeuronLink + CPU DDR5 / 本地 NVMe 分层

Trainium2 的内存故事是“云实例即产品”:HBM、主机 DDR5、本地 NVMe 和 EFA 构成完整层次。

工艺 / 封装
第三代 NeuronCore
存储
96 GB HBM3 / 芯片
存储带宽
约 2.9 TB/s / 芯片
峰值计算
1.3 PFLOPS FP8 Dense
功耗
未公开
互联
NeuronLink · EFAv3

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

NeuronCore Local Memory

算子局部复用

由编译器与 NKI kernel 映射,公开容量有限。

02

HBM3

加速器主存

单芯片 96 GB;16 芯片实例合计 1.5 TB。

03

NeuronLink

实例内 scale-up

point-to-point 2D Torus,避免集中式交换芯片。

04

DDR5 / NVMe

主机与存储层

CPU 头节点和可直达本地 NVMe 承担数据集与检查点。

Architecture note

如何理解这颗芯片

Trainium2 通过 EC2 Trn2 实例交付。单实例含 16 芯片、1.5 TB HBM3 和 46 TB/s 聚合带宽;UltraServer 将 64 芯片连接为更大的计算域。

AWS 的差异化在于把 NeuronCore、HBM、NeuronLink、EFA 网络与 Neuron SDK 一起作为云服务产品,而非单独销售芯片。

主要存储瓶颈

无交换 torus 的跳数与拓扑映射会影响 collective;软件需让张量分片与物理邻接匹配。

Evidence

资料入口