FAMAFlagship AI Accelerator Memory ArchitecturesFAMA

High Bandwidth Memory

HBM3e → HBM4

用超宽接口把 DRAM 搬到计算封装旁边

HBM 通过 TSV 垂直堆叠 DRAM,并借助硅中介层或先进封装与加速器并排连接。HBM4 把接口宽度翻倍到 2048-bit 级,并开始让逻辑基底承担更多定制功能。

HBM4 36 GB 12H 量产 · 48 GB 16H 送样(Micron)核验 2026-09-14
HBM4 接口
2048-bit / stack
单堆栈带宽
>2.8 TB/s(厂商产品)
单堆栈容量
36 GB 12H;48 GB 16H 送样
AI 角色
权重、KV Cache、激活主存

怎么工作

  • 01TSV 把多层 DRAM 垂直连接。
  • 02宽并行接口以较低每 pin 速率换取极高总带宽。
  • 03逻辑 base die 与 GPU/ASIC 的封装协同变得更深。

在 AI 系统中的角色

  • 01训练时承载权重、激活与优化器状态。
  • 02decode 时持续流式读取权重和 KV Cache。
  • 03容量决定模型驻留与 batch,上行带宽决定 memory-bound token 速度。

关键取舍

  • 01先进封装产能、良率与散热共同抬高成本。
  • 02每字节成本显著高于 DDR/LPDDR/Flash。
  • 03算力增长仍快于带宽增长,需要缓存、量化和 kernel 融合。

阅读提示

带宽峰值是物理接口上限,不等于应用有效带宽。评价任何 Memory 技术时,都要同时检查访问粒度、随机性、复用、控制器开销、热设计与软件可见性。

Further reading

继续阅读