Architecture note
如何理解这颗芯片
Jalapeño 是 OpenAI 与 Broadcom 联合开发的首代推理加速器。公开材料强调“芯片—内存—网络—软件—机架”的全栈设计,而没有公布 HBM 容量或峰值 FLOPS。
其核心思想是让模型状态和 KV Cache 显式放置并尽量保持局部,在 prefill 与 decode 之间激活合适的计算、内存和网络资源。公开性能结果采用整系统延迟与每瓦吞吐,而非单芯片峰值。
主要存储瓶颈
目前缺少容量、带宽、缓存层次和工艺等硬规格,不能与 GPU 做逐字段公平比较。