Architecture note
如何理解这颗芯片
Trainium3 采用 3 nm 工艺和 8 个 NeuronCore-v4,单芯片配备 144 GB HBM3E、4.9 TB/s 带宽与 2.52 PFLOPS FP8。
Trn3 UltraServer 可组织最多 144 颗芯片,软件侧由 Neuron SDK 处理图编译、分布式训练和推理部署。
主要存储瓶颈
大规模 UltraServer 的有效性能受图切分、collective 与 Neuron 编译覆盖度影响。
NeuronCore-v4 · 2026
以更大 HBM3E 和 144 芯片 UltraServer 扩大 AWS 自研训练与推理域。
Memory thesis
Trainium3 用云内垂直整合把 HBM、互联、实例和编译器绑定成一个可持续迭代的平台。
Memory hierarchy
沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。
服务张量、向量、标量与 collective 引擎。
144 GB、4.9 TB/s。
最多 144 颗 Trainium3 组成高带宽训练/推理域。
Architecture note
Trainium3 采用 3 nm 工艺和 8 个 NeuronCore-v4,单芯片配备 144 GB HBM3E、4.9 TB/s 带宽与 2.52 PFLOPS FP8。
Trn3 UltraServer 可组织最多 144 颗芯片,软件侧由 Neuron SDK 处理图编译、分布式训练和推理部署。
主要存储瓶颈
大规模 UltraServer 的有效性能受图切分、collective 与 Neuron 编译覆盖度影响。
Evidence