Architecture note
如何理解这颗芯片
Rubin 延续通用 GPU 路线,但设计边界已从单颗 GPU 扩展到整机架。双计算裸片通过 NV-HBI 统一,计算、HBM4、CPU 一致性互联与 scale-up 网络共同决定可实现性能。
对大模型而言,288 GB HBM4 主要扩大模型、KV Cache 与并发请求的驻留空间;22 TB/s 带宽则直接服务 decode 阶段持续搬运权重与 KV 状态。
主要存储瓶颈
计算峰值提升快于每字节可用带宽,低 batch decode、长上下文 attention 与 MoE 路由仍依赖数据局部性和融合 kernel。