FAMAFlagship AI Accelerator Memory ArchitecturesFAMA

Accelerator index

AI 芯片库

从存储层次进入芯片:看容量、带宽、片上缓存、数据搬移和互联。未知字段保持未知;每项正式条目至少有一份官方资料。

官方来源覆盖 26 / 26

每个条目都通过官方来源门槛

26 / 26
ASIC2026

Google · 第八代 TPU · Inference

TPU 8i

用更大的 HBM 与片上 VMEM,加上 Boardfly 拓扑,专门优化大模型推理的访存与扩展效率。

存储
288 GB HBM + 384 MB VMEM
带宽
8.6 TB/s HBM
2 个官方来源已核验
查看存储架构
ASIC2026

Google · 第八代 TPU · Training

TPU 8t

以 9,600 芯片 Superpod 和 3D Torus 扩展域服务下一代基础模型训练。

存储
216 GB HBM + 128 MB VMEM
带宽
6.53 TB/s HBM
1 个官方来源已核验
查看存储架构
GPU2026

AMD · MI400 · CDNA 5

Instinct MI455X

12 栈 HBM4 与 3D 混合键合计算裸片把 MI400 推向 72-GPU Helios 机架级系统。

存储
432 GB HBM4 · 12 stacks
带宽
23.3 TB/s
2 个官方来源已核验
查看存储架构
GPU2027

AMD · MI400 · Sovereign AI / HPC

Instinct MI430X

在 MI400 封装基础上强化硬件 FP64,面向国家级 AI 与科学计算基础设施。

存储
432 GB HBM4
带宽
最高 23.3 TB/s / GPU
2 个官方来源已核验
查看存储架构
近存计算2026

Xiaomi · XRING · AI Accelerator

玄戒 O100

把 AI 专用内存垂直堆叠在计算层附近,以 1.22 TB/s 带宽突破端侧 DRAM 墙。

存储
3.5 GB AI 专用内存
带宽
1.22 TB/s
1 个官方来源已核验
查看存储架构
ASIC2026

Xiaomi · XRING · Intelligent Driving

玄戒 D100

以大容量统一内存承载 200B+ 车端模型,把智驾计算从固定算子推向大模型域控。

存储
最高 160 GB 统一内存
带宽
未披露
1 个官方来源已核验
查看存储架构
ASIC2026

Li Auto · MAHE · Automotive AI

马赫 M100

以编译器管理的动态数据流替代传统缓存依赖,让有限 LPDDR 带宽服务高算力车端模型。

存储
8-channel LPDDR5X
带宽
273 GB/s
2 个官方来源已核验
查看存储架构
近存计算2027

d-Matrix · 第二代 Digital In-Memory Compute

Raptor 3DIMC

把定制 DRAM 直接堆在数字近存计算裸片上,目标是绕开 HBM PHY 的带宽与能耗边界。

存储
目标 32 GB / card
带宽
目标 100 TB/s / card
4 个官方来源已核验
查看存储架构
ASIC2026

SambaNova · 第五代 Reconfigurable Dataflow Unit

SN50 RDU

以 SRAM、HBM2E、DDR5 三层显式数据流存储,换取大模型推理的容量和带宽平衡。

存储
432 MB SRAM + 64 GB HBM2E + 512 GB DDR5
带宽
分层带宽 · 官方未给总值
2 个官方来源已核验
查看存储架构
ASIC2026

AWS · NeuronCore-v4

Trainium3

以更大 HBM3E 和 144 芯片 UltraServer 扩大 AWS 自研训练与推理域。

存储
144 GB HBM3E
带宽
4.9 TB/s
2 个官方来源已核验
查看存储架构
GPU2026

Intel · Xe3P Data Center GPU

Crescent Island

用 160 GB LPDDR5X 把容量与每瓦成本放在首位,瞄准 agentic inference。

存储
160 GB LPDDR5X
带宽
未正式披露 · 容量/能效优先
2 个官方来源已核验
查看存储架构
ASIC2026

Qualcomm · Data Center AI

Dragonfly AI200

用每卡 768 GB LPDDR5X 和 56 卡整柜容量挑战 HBM-only 推理系统的成本结构。

存储
768 GB LPDDR5X / card
带宽
0.414 PB/s / rack aggregate
2 个官方来源已核验
查看存储架构
GPU2026

NVIDIA · Vera Rubin

Rubin GPU

把 HBM4、TMA 与 NVLink 6 组合成面向长上下文 Agent 的机架级存储与通信域。

存储
288 GB HBM4
带宽
22 TB/s
2 个官方来源已核验
查看存储架构
GPU2024

NVIDIA · Blackwell

Blackwell B200

Blackwell 以双裸片、HBM3e 和 NVLink 5 奠定“GPU 即系统节点”的主流范式。

存储
180 GB HBM3e
带宽
最高 8 TB/s
1 个官方来源已核验
查看存储架构
GPU2025

AMD · CDNA 4

Instinct MI355X

以 288 GB HBM3e、256 MB Infinity Cache 与 3D Chiplet 争取更大的单卡模型驻留空间。

存储
288 GB HBM3e
带宽
8 TB/s
2 个官方来源已核验
查看存储架构
GPU2023

AMD · CDNA 3

Instinct MI300X

八个计算裸片在四个 I/O Die 上方工作,以统一地址空间呈现 192 GB HBM3。

存储
192 GB HBM3
带宽
5.3 TB/s
1 个官方来源已核验
查看存储架构
ASIC2025

Google · 7th Gen TPU

TPU7x · Ironwood

两个各自拥有 96 GB HBM 的计算 Chiplet,通过高速 D2D 与 3D Torus 扩展到 9,216 芯片。

存储
192 GiB HBM / 芯片
带宽
7.38 TB/s / 芯片
1 个官方来源已核验
查看存储架构
ASIC2026

Microsoft · Maia Gen 2

Maia 200

以 HBM3e、大片上 SRAM、专用 DMA 与两级以太网 scale-up 共同优化 token 生成经济性。

存储
216 GB HBM3e + 272 MB SRAM
带宽
7 TB/s HBM
1 个官方来源已核验
查看存储架构
ASIC2026

OpenAI × Broadcom · Gen 1 Intelligence Processor

Jalapeño

围绕 prefill、decode 与 KV Cache 局部性设计的 OpenAI 首款 LLM 推理芯片。

存储
容量与介质未公开
带宽
未公开
2 个官方来源已核验
查看存储架构
ASIC2024

AWS · Trn2

Trainium2

从单芯片 HBM3 到 64 芯片 UltraServer,以无交换 point-to-point NeuronLink 形成云内 scale-up。

存储
96 GB HBM3 / 芯片
带宽
约 2.9 TB/s / 芯片
1 个官方来源已核验
查看存储架构
ASIC2024

Intel · Gaudi

Gaudi 3

以大片上 SRAM、HBM2e 和片上 200GbE 端口坚持开放以太网扩展路线。

存储
128 GB HBM2e + 96 MB SRAM
带宽
3.7 TB/s HBM · 12.8 TB/s SRAM
1 个官方来源已核验
查看存储架构
晶圆级2024

Cerebras · CS-3 / CS-4

WSE-3

把 44 GB SRAM 铺满晶圆,牺牲容量换取极低延迟与 PB/s 级片上数据流。

存储
44 GB 片上 SRAM
带宽
约 21 PB/s 片上
1 个官方来源已核验
查看存储架构
ASIC2026

Meta · MTIA Roadmap

MTIA 300

以六个月级快速迭代和工作负载定制为核心,具体存储规格仍保持未披露。

存储
未公开
带宽
官方仅披露代际提升
1 个官方来源已核验
查看存储架构
ASIC2026 Q4

华为 · Ascend 950

昇腾 950DT

把 prefill 与 decode 拆成不同存储配置,950DT 以高带宽 HBM 专攻 decode 和训练。

存储
144 GB HiZQ 2.0 HBM
带宽
4 TB/s
1 个官方来源已核验
查看存储架构
近存计算2026

东方算芯 · DF1000

巅峯 DF1000

在 14 nm 下用逻辑—DRAM 晶圆级混合键合缩短数据路径,以架构换制程。

存储
3D DRAM 近存计算 · 容量未公开
带宽
官方称较传统方案数量级提升
2 个官方来源已核验
查看存储架构
ASIC2021–2025

Tesla · Dojo

Dojo D1

25 颗无封装 D1 组成训练 Tile,以边缘互联和分布式 SRAM 追求“计算平面连续化”。

存储
1.25 MB SRAM / 节点 · 外部 DRAM
带宽
Tile 36 TB/s 边缘带宽(发布口径)
1 个官方来源已核验
查看存储架构