FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
SambaNovaASIC已发布

第五代 Reconfigurable Dataflow Unit · 2026

SN50 RDU

以 SRAM、HBM2E、DDR5 三层显式数据流存储,换取大模型推理的容量和带宽平衡。

2 个官方来源可信度 核验 2026-09-04

Memory thesis

SRAM + HBM2E + DDR5 显式分层数据流

SN50 代表“分层内存 + 编译器调度”路线,值得与统一 HBM GPU 和近存计算进行横向比较。

工艺 / 封装
TSMC 5 nm
存储
432 MB SRAM + 64 GB HBM2E + 512 GB DDR5
存储带宽
分层带宽 · 官方未给总值
峰值计算
1.6 PFLOPS BF16 · 3.2 PFLOPS FP8
功耗
未披露
互联
最高 256 RDU scale-out

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

Distributed SRAM

流水线局部状态

432 MB 片上 SRAM,围绕数据流单元分布,承接高复用张量。

02

HBM2E

高带宽模型工作集

64 GB,服务不能完全驻留片上的权重与激活。

03

DDR5

大容量模型与 KV 层

最高 512 GB,以较低成本扩大单 RDU 可承载模型规模。

04

Scale-out Fabric

跨 RDU 模型扩展

系统最多扩展到 256 颗 RDU。

Architecture note

如何理解这颗芯片

SN50 是 SambaNova 第五代 RDU。它不是传统缓存型 GPU,而是由编译器把算子和数据映射到可重构数据流结构,并在 432 MB SRAM、64 GB HBM2E 与最高 512 GB DDR5 之间显式组织工作集。

这种分层容量特别适合 memory-bound inference:热数据留在 SRAM/HBM,更大的模型和 KV 状态进入 DDR5,但软件映射质量会直接影响有效带宽。

主要存储瓶颈

DDR5 容量很大但带宽低于 HBM;性能依赖编译器能否把热工作集稳定放进 SRAM/HBM。

Evidence

资料入口