FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
Cerebras晶圆级系统部署

CS-3 / CS-4 · 2024

WSE-3

把 44 GB SRAM 铺满晶圆,牺牲容量换取极低延迟与 PB/s 级片上数据流。

1 个官方来源可信度 核验 2026-09-04

Memory thesis

全晶圆分布式 SRAM + 数据流路由

WSE-3 代表极端 SRAM machine:把内存墙移到晶圆外 I/O 与模型切分位置。

工艺 / 封装
TSMC 5 nm · 晶圆级
存储
44 GB 片上 SRAM
存储带宽
约 21 PB/s 片上
峰值计算
125 PFLOPS(厂商稀疏口径)
功耗
约 25 kW / WSE 系统级
互联
SwarmX · 12 × 100GbE I/O

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

Core-local SRAM

权重/激活本地存储

分布到约 90 万个核心旁,合计 44 GB。

02

On-wafer Fabric

SRAM 间数据流

二维 mesh 跨越曝光场边界,提供 PB/s 级聚合带宽。

03

SwarmX / Ethernet

跨系统扩展

承担多晶圆流水和外部数据输入,带宽远低于片上。

04

KVSS DDR5

KV Cache 外置层

系统可配大容量 CPU DDR5 节点扩展 KV 存储。

Architecture note

如何理解这颗芯片

WSE-3 用单片晶圆级处理器消除传统多芯片边界,约一半硅面积用于分布式 SRAM。权重和激活若能驻留在晶圆上,可避免 HBM 与 off-package 通信。

代价是容量仅 44 GB,模型往往必须跨多片晶圆按层流水。外部 I/O 远低于片上带宽,因此映射策略与模型大小决定实际优势。

主要存储瓶颈

44 GB 容量和有限 off-wafer I/O 使超大模型必须流水化;SRAM 密度缩放放缓也限制后续容量增长。

Evidence

资料入口