FAMAFlagship AI Accelerator Memory ArchitecturesFAMA

Memory technology

存储技术专题

AI 系统不是只有“显存”。从片上 SRAM、封装内 HBM,到主机 DDR、低功耗 LPDDR 与新兴 HBF,每一层都在容量、带宽、延迟、能效和成本之间交换。

01 · High Bandwidth Memory

HBM3e → HBM4

用超宽接口把 DRAM 搬到计算封装旁边

HBM 通过 TSV 垂直堆叠 DRAM,并借助硅中介层或先进封装与加速器并排连接。HBM4 把接口宽度翻倍到 2048-bit 级,并开始让逻辑基底承担更多定制功能。

HBM4 接口 · 2048-bit / stack单堆栈带宽 · >2.8 TB/s(厂商产品)单堆栈容量 · 36 GB 12H;48 GB 16H 送样

HBM4 36 GB 12H 量产 · 48 GB 16H 送样(Micron)

02 · Low Power Double Data Rate DRAM

LPDDR5X → LPDDR6

以能效和容量密度承接端侧 AI,也开始进入服务器

LPDDR 原本服务移动设备,随着边缘模型和推理服务器追求每瓦容量,它正扩展到 AI PC、汽车与大容量服务器。LPDDR6 通过更多、更窄的子通道提高并发,并加强动态电压频率管理。

LPDDR6 厂商速度 · 10.7–14.4 Gbps / pin产品带宽示例 · 最高 125 GB/s能效改善 · 最高约 21% vs LPDDR5X

LPDDR5X 广泛量产 · LPDDR6 初期导入

03 · Double Data Rate Main Memory

DDR5 / MRDIMM

容量、可维护性与成本主导的主机内存层

DDR5 是 CPU 主存与大容量内存池的基础。MRDIMM 通过多路复用 rank 和缓冲逻辑提升有效数据率,使主机侧带宽更适合数据预处理、Embedding、KV Cache 卸载与 disaggregated serving。

DDR5 基础 · 双 32-bit 子通道 / DIMMMRDIMM 路线 · Gen2 目标 12,800 MT/s优势 · 高容量、可插拔、低成本/bit

DDR5 主流 · MRDIMM 加速导入

04 · High Bandwidth Flash

HBF

把 NAND 做成封装内高带宽容量层,瞄准权重与 KV 的冷/温数据

HBF 试图在 HBM 与 SSD 之间建立新层级:使用堆叠 NAND、宽 package-local 接口和面向只读/低写入 AI 数据的控制方式,以 TB 级容量和接近 HBM 的顺序读取带宽降低每 bit 成本。

首版容量目标 · 最高 512 GB / package带宽目标 · 最高约 3 TB/s堆叠 · 8-Hi / 16-Hi NAND

2026 首版开放规格 · 工程导入期

一套统一的阅读方法

先问数据放在哪里,再问每秒搬多少、搬一次耗多少能量、谁管理搬移,最后才看计算峰值。这样才能把芯片规格连接到 prefill、decode、训练和推荐等真实工作负载。