Google · 第八代 TPU · Inference
TPU 8i
用更大的 HBM 与片上 VMEM,加上 Boardfly 拓扑,专门优化大模型推理的访存与扩展效率。
- 存储
- 288 GB HBM + 384 MB VMEM
- 带宽
- 8.6 TB/s HBM
Accelerator index
从存储层次进入芯片:看容量、带宽、片上缓存、数据搬移和互联。未知字段保持未知;每项正式条目至少有一份官方资料。
每个条目都通过官方来源门槛
Google · 第八代 TPU · Inference
用更大的 HBM 与片上 VMEM,加上 Boardfly 拓扑,专门优化大模型推理的访存与扩展效率。
Google · 第八代 TPU · Training
以 9,600 芯片 Superpod 和 3D Torus 扩展域服务下一代基础模型训练。
AMD · MI400 · CDNA 5
12 栈 HBM4 与 3D 混合键合计算裸片把 MI400 推向 72-GPU Helios 机架级系统。
AMD · MI400 · Sovereign AI / HPC
在 MI400 封装基础上强化硬件 FP64,面向国家级 AI 与科学计算基础设施。
Xiaomi · XRING · AI Accelerator
把 AI 专用内存垂直堆叠在计算层附近,以 1.22 TB/s 带宽突破端侧 DRAM 墙。
Xiaomi · XRING · Intelligent Driving
以大容量统一内存承载 200B+ 车端模型,把智驾计算从固定算子推向大模型域控。
Li Auto · MAHE · Automotive AI
以编译器管理的动态数据流替代传统缓存依赖,让有限 LPDDR 带宽服务高算力车端模型。
d-Matrix · 第二代 Digital In-Memory Compute
把定制 DRAM 直接堆在数字近存计算裸片上,目标是绕开 HBM PHY 的带宽与能耗边界。
SambaNova · 第五代 Reconfigurable Dataflow Unit
以 SRAM、HBM2E、DDR5 三层显式数据流存储,换取大模型推理的容量和带宽平衡。
AWS · NeuronCore-v4
以更大 HBM3E 和 144 芯片 UltraServer 扩大 AWS 自研训练与推理域。
Intel · Xe3P Data Center GPU
用 160 GB LPDDR5X 把容量与每瓦成本放在首位,瞄准 agentic inference。
Qualcomm · Data Center AI
用每卡 768 GB LPDDR5X 和 56 卡整柜容量挑战 HBM-only 推理系统的成本结构。
NVIDIA · Vera Rubin
把 HBM4、TMA 与 NVLink 6 组合成面向长上下文 Agent 的机架级存储与通信域。
NVIDIA · Blackwell
Blackwell 以双裸片、HBM3e 和 NVLink 5 奠定“GPU 即系统节点”的主流范式。
AMD · CDNA 4
以 288 GB HBM3e、256 MB Infinity Cache 与 3D Chiplet 争取更大的单卡模型驻留空间。
AMD · CDNA 3
八个计算裸片在四个 I/O Die 上方工作,以统一地址空间呈现 192 GB HBM3。
Google · 7th Gen TPU
两个各自拥有 96 GB HBM 的计算 Chiplet,通过高速 D2D 与 3D Torus 扩展到 9,216 芯片。
Microsoft · Maia Gen 2
以 HBM3e、大片上 SRAM、专用 DMA 与两级以太网 scale-up 共同优化 token 生成经济性。
OpenAI × Broadcom · Gen 1 Intelligence Processor
围绕 prefill、decode 与 KV Cache 局部性设计的 OpenAI 首款 LLM 推理芯片。
AWS · Trn2
从单芯片 HBM3 到 64 芯片 UltraServer,以无交换 point-to-point NeuronLink 形成云内 scale-up。
Intel · Gaudi
以大片上 SRAM、HBM2e 和片上 200GbE 端口坚持开放以太网扩展路线。
Cerebras · CS-3 / CS-4
把 44 GB SRAM 铺满晶圆,牺牲容量换取极低延迟与 PB/s 级片上数据流。
Meta · MTIA Roadmap
以六个月级快速迭代和工作负载定制为核心,具体存储规格仍保持未披露。
华为 · Ascend 950
把 prefill 与 decode 拆成不同存储配置,950DT 以高带宽 HBM 专攻 decode 和训练。
东方算芯 · DF1000
在 14 nm 下用逻辑—DRAM 晶圆级混合键合缩短数据路径,以架构换制程。
Tesla · Dojo
25 颗无封装 D1 组成训练 Tile,以边缘互联和分布式 SRAM 追求“计算平面连续化”。