FAMAFlagship AI Accelerator Memory ArchitecturesFAMA
OpenAI × BroadcomASIC工程样片 / 年底部署

Gen 1 Intelligence Processor · 2026

Jalapeño

围绕 prefill、decode 与 KV Cache 局部性设计的 OpenAI 首款 LLM 推理芯片。

2 个官方来源可信度 核验 2026-09-04

Memory thesis

显式局部张量 + KV Cache locality + 系统级内存/网络协同

Jalapeño 最值得跟踪的是“模型驱动硬件”和 KV Cache 局部放置;在硬规格披露前应把未知明确保留为空。

工艺 / 封装
定制推理 ASIC · 具体工艺未正式披露
存储
容量与介质未公开
存储带宽
未公开
峰值计算
未公开
功耗
700 W 额定 · 实测 ≤550 W
互联
系统级网络协同 · 规格未公开

Memory hierarchy

存储层次

沿着数据离计算核心越来越远的方向阅读。真实带宽不只取决于介质,也取决于布局、复用和互联。

01

Local Tensors

可预测的局部存储

编程模型显式描述数据位置、通信与同步。

02

Model State / KV Cache

长驻数据

设计目标是尽量保持本地,减少跨资源搬移。

03

Integrated Network

跨芯片状态交换

网络被视为体系结构的一部分,而非外围 I/O。

04

Rack-scale Domain

完整请求执行域

以大连接域降低通信延迟,具体容量与带宽尚未公开。

Architecture note

如何理解这颗芯片

Jalapeño 是 OpenAI 与 Broadcom 联合开发的首代推理加速器。公开材料强调“芯片—内存—网络—软件—机架”的全栈设计,而没有公布 HBM 容量或峰值 FLOPS。

其核心思想是让模型状态和 KV Cache 显式放置并尽量保持局部,在 prefill 与 decode 之间激活合适的计算、内存和网络资源。公开性能结果采用整系统延迟与每瓦吞吐,而非单芯片峰值。

主要存储瓶颈

目前缺少容量、带宽、缓存层次和工艺等硬规格,不能与 GPU 做逐字段公平比较。

Evidence

资料入口