FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
AWSASIC已发布

NeuronCore-v4 · 2026

Trainium3

以更大 HBM3E 和 144 芯片 UltraServer 扩大 AWS 自研训练与推理域。

2 个官方来源可信度 核验 2026-09-04

Memory thesis

HBM3E + NeuronLink scale-up

Trainium3 用云内垂直整合把 HBM、互联、实例和编译器绑定成一个可持续迭代的平台。

工艺 / 封装
3 nm · 8 NeuronCore-v4
存储
144 GB HBM3E
存储带宽
4.9 TB/s
峰值计算
2.52 PFLOPS FP8
功耗
未披露
互联
NeuronLink · 144-chip UltraServer

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

NeuronCore Local Memory

算子局部复用

服务张量、向量、标量与 collective 引擎。

02

HBM3E

模型与训练状态

144 GB、4.9 TB/s。

03

NeuronLink

UltraServer 内扩展

最多 144 颗 Trainium3 组成高带宽训练/推理域。

Architecture note

如何理解这颗芯片

Trainium3 采用 3 nm 工艺和 8 个 NeuronCore-v4,单芯片配备 144 GB HBM3E、4.9 TB/s 带宽与 2.52 PFLOPS FP8。

Trn3 UltraServer 可组织最多 144 颗芯片,软件侧由 Neuron SDK 处理图编译、分布式训练和推理部署。

主要存储瓶颈

大规模 UltraServer 的有效性能受图切分、collective 与 Neuron 编译覆盖度影响。

Evidence

资料入口