Architecture note
如何理解这颗芯片
Maia 200 是面向推理的云端 ASIC,官方把内存系统而非峰值 FLOPS 放在核心位置:216 GB HBM3e、272 MB SRAM、专用 DMA 与 NoC 协同工作。
系统层采用两级 scale-up 网络,单加速器暴露 2.8 TB/s 双向带宽,并在托盘内以四颗芯片直连,减少交换跳数。
主要存储瓶颈
prefill 与 decode 的算术强度不同;固定硬件需依靠 DMA、NoC 和软件映射在两个阶段间保持高利用率。
Maia Gen 2 · 2026
以 HBM3e、大片上 SRAM、专用 DMA 与两级以太网 scale-up 共同优化 token 生成经济性。
Memory thesis
Maia 200 是“数据搬移引擎优先”的推理 ASIC:SRAM、DMA、NoC 与网络是一条连续的数据路径。
Memory hierarchy
沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。
272 MB,服务低延迟复用与窄精度数据路径。
把计算与数据传输重叠,减少核心等待。
216 GB、7 TB/s,容量与带宽兼顾。
托盘内直连,跨机架沿用统一传输协议。
Architecture note
Maia 200 是面向推理的云端 ASIC,官方把内存系统而非峰值 FLOPS 放在核心位置:216 GB HBM3e、272 MB SRAM、专用 DMA 与 NoC 协同工作。
系统层采用两级 scale-up 网络,单加速器暴露 2.8 TB/s 双向带宽,并在托盘内以四颗芯片直连,减少交换跳数。
主要存储瓶颈
prefill 与 decode 的算术强度不同;固定硬件需依靠 DMA、NoC 和软件映射在两个阶段间保持高利用率。
Evidence