FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
QualcommASIC商用导入

Data Center AI · 2026

Dragonfly AI200

用每卡 768 GB LPDDR5X 和 56 卡整柜容量挑战 HBM-only 推理系统的成本结构。

2 个官方来源可信度 核验 2026-09-04

Memory thesis

超大容量 LPDDR5X + rack-scale fabric

AI200 是“容量/能效优先”数据中心推理的关键对照组,尤其适合评估单位模型容量成本。

工艺 / 封装
Qualcomm Hexagon NPU architecture
存储
768 GB LPDDR5X / card
存储带宽
0.414 PB/s / rack aggregate
峰值计算
未披露
功耗
140 kW / rack
互联
PCIe 6 scale-up · Ethernet/RoCE scale-out

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

NPU Local Memory

张量局部复用

继承 Hexagon 数据路径,具体容量待数据表。

02

LPDDR5X

模型和 KV 主存

每卡 768 GB,容量显著高于主流 HBM 加速卡。

03

Rack Memory Domain

整柜模型分片

56 卡约 43 TB,官方聚合带宽 0.414 PB/s。

Architecture note

如何理解这颗芯片

Dragonfly AI200 把 Qualcomm 的 NPU 能效路线带入数据中心。单卡 768 GB LPDDR5X,56 卡机架合计约 43 TB 内存,适合容量密集型 LLM serving。

它使用 PCIe 6 做 scale-up、Ethernet/RoCE 做 scale-out。官方给出整柜聚合带宽,但尚未披露单芯峰值算力和单卡带宽,分析时不能直接与 HBM GPU 的单卡 TB/s 对比。

主要存储瓶颈

LPDDR 高容量路线要求软件充分利用批处理、量化和分片,否则低于 HBM 的单卡带宽会限制 token 速率。

Evidence

资料入口