FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
NVIDIAGPU量产导入

Vera Rubin · 2026

Rubin GPU

把 HBM4、TMA 与 NVLink 6 组合成面向长上下文 Agent 的机架级存储与通信域。

2 个官方来源可信度 核验 2026-09-04

Memory thesis

HBM4 + 集中式 L2 + 软件管理的数据搬移

Rubin 的关键不是“更多 HBM”本身,而是把 HBM4、TMA、NVLink 与机架拓扑作为同一个内存系统联合设计。

工艺 / 封装
双计算裸片 · NV-HBI
存储
288 GB HBM4
存储带宽
22 TB/s
峰值计算
50 PFLOPS NVFP4 推理
功耗
平台级液冷
互联
NVLink 6 · 3.6 TB/s

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

Tensor / Shared Memory

线程块局部复用

靠近 Tensor Core,由编译器与 kernel 显式组织局部数据。

02

Central L2

跨 GPC 共享缓存

为两个计算裸片后的全局访问提供统一缓冲层。

03

HBM4

模型权重与 KV Cache 主存

最高 288 GB、22 TB/s;2048-bit 级宽接口把带宽推到 HBM3e 的数倍。

04

NVLink 6 Domain

跨 GPU 扩展内存域

单 GPU 3.6 TB/s scale-up 带宽,服务 MoE 权重与 token 交换。

Architecture note

如何理解这颗芯片

Rubin 延续通用 GPU 路线,但设计边界已从单颗 GPU 扩展到整机架。双计算裸片通过 NV-HBI 统一,计算、HBM4、CPU 一致性互联与 scale-up 网络共同决定可实现性能。

对大模型而言,288 GB HBM4 主要扩大模型、KV Cache 与并发请求的驻留空间;22 TB/s 带宽则直接服务 decode 阶段持续搬运权重与 KV 状态。

主要存储瓶颈

计算峰值提升快于每字节可用带宽,低 batch decode、长上下文 attention 与 MoE 路由仍依赖数据局部性和融合 kernel。

Evidence

资料入口