FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
MicrosoftASICAzure 部署

Maia Gen 2 · 2026

Maia 200

以 HBM3e、大片上 SRAM、专用 DMA 与两级以太网 scale-up 共同优化 token 生成经济性。

1 个官方来源可信度 核验 2026-09-04

Memory thesis

272 MB SRAM + 216 GB HBM3e + DMA / NoC

Maia 200 是“数据搬移引擎优先”的推理 ASIC:SRAM、DMA、NoC 与网络是一条连续的数据路径。

工艺 / 封装
TSMC 3 nm · 140B+ 晶体管
存储
216 GB HBM3e + 272 MB SRAM
存储带宽
7 TB/s HBM
峰值计算
10+ PFLOPS FP4
功耗
750 W SoC TDP
互联
2.8 TB/s 双向 scale-up

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

On-die SRAM

热点权重与中间状态

272 MB,服务低延迟复用与窄精度数据路径。

02

Specialized DMA

异步数据搬移

把计算与数据传输重叠,减少核心等待。

03

HBM3e

模型与 KV Cache 主存

216 GB、7 TB/s,容量与带宽兼顾。

04

Ethernet Scale-up

跨芯片扩展域

托盘内直连,跨机架沿用统一传输协议。

Architecture note

如何理解这颗芯片

Maia 200 是面向推理的云端 ASIC,官方把内存系统而非峰值 FLOPS 放在核心位置:216 GB HBM3e、272 MB SRAM、专用 DMA 与 NoC 协同工作。

系统层采用两级 scale-up 网络,单加速器暴露 2.8 TB/s 双向带宽,并在托盘内以四颗芯片直连,减少交换跳数。

主要存储瓶颈

prefill 与 decode 的算术强度不同;固定硬件需依靠 DMA、NoC 和软件映射在两个阶段间保持高利用率。

Evidence

资料入口