
2026 年 8 月 25 日,SemiAnalysis 公布了对 OpenAI 首款自研推理芯片 Jalapeño 的现场测试和架构分析。两个月前,OpenAI 与 Broadcom 已经正式宣布这款芯片,并明确把它定位为面向大语言模型推理的专用加速器。官方当时给出的信息相对克制:Jalapeño 从零开始设计,重点优化模型推理中的计算、内存移动、网络和服务调度,工程样片已经能够以目标频率和功耗运行;SemiAnalysis 此次进一步给出了性能、功耗、内存带宽和机架级系统的实测或工程数据。两类信息需要分开看:芯片存在、设计目标和合作伙伴来自 OpenAI 官方,具体跑分和部分架构细节主要来自 SemiAnalysis,尚缺少更广泛的独立测试。
Jalapeño 值得写,并不只是因为它在某几组基准上比 NVIDIA Blackwell 更快。更重要的变化发生在芯片设计逻辑上。过去十多年,AI 计算的主角一直是 GPU:训练需要大规模矩阵乘法,推理同样可以在 GPU 上完成,成熟的 CUDA、通信库、编译器和集群软件让 GPU 成为风险最低的选择。但大模型推理的负载特征越来越特殊,特别是长上下文、KV Cache、低时延交互、连续批处理和智能体多轮任务出现以后,一部分 GPU 为通用性付出的硬件和软件成本开始显得昂贵。OpenAI 试图做的事情,是把自己每天在 ChatGPT、Codex 和 API 上看到的真实推理负载,直接写进芯片和系统设计。
推理芯片首先要解决的,不是峰值 FLOPS,而是数据怎么移动
大模型推理很容易被简化成“矩阵乘法速度竞赛”,实际上部署端常常先撞上内存和通信瓶颈。一次解码只生成一个或几个 Token,模型权重需要不断被读取,Attention 又需要访问越来越大的 KV Cache;如果并发量不高,单次矩阵规模并不大,GPU 上很多为大批量吞吐设计的机制很难完全吃满。峰值算力再高,如果数据到不了计算单元,或者每一步都要付出较高的内核启动、同步和访存延迟,用户看到的仍然是较慢的首 Token 时间和较低的单用户生成速度。
SemiAnalysis 披露的 Jalapeño 设计把“减少数据移动”放在很高的位置。B0 stepping 采用台积电 N3P 工艺,单个计算晶粒提供约 13.4 PFLOPS 的 MXFP4 峰值计算能力,额定 TDP 为 700W;芯片配套 HBM4,单封装内存带宽约 15.4TB/s。数字本身很亮眼,但更有意思的是内存组织方式:计算核心和 HBM 被划分成若干 slice,每个核心 slice 对自己的 HBM slice 保持低时延本地视图,跨 slice 的同步尽量限制在已知、可预测的高带宽集合通信里。OpenAI 的目标显然不是再堆一层复杂缓存去“掩盖”延迟,而是让权重和 KV 的放置尽量可控,从拓扑上减少绕路。
矩阵引擎采用类似 TPU 的 weight-stationary systolic array,但支持较小的矩阵形状;通用核心部分又保留 64 位标量单元、FP32/INT32 向量单元以及乱序执行能力。这种组合说明 Jalapeño 并没有把自己做成只能跑某一种固定网络结构的“死 ASIC”。它仍然需要应对模型尺寸、批量、Attention 结构、MoE、量化格式不断变化的现实,只是把硬件资源集中到 LLM 推理最常见的路径上。

OpenAI 为什么没有把 Prefill 和 Decode 拆到两套芯片池里
大模型推理系统近几年很流行 Prefill/Decode Disaggregation。Prefill 需要快速处理长输入,计算密度较高;Decode 每一步生成少量 Token,更依赖内存带宽和低延迟。理论上,把两阶段放到不同硬件池,可以让各自获得更高局部利用率。Jalapeño 目前却选择同质化资源池,Prefill 和 Decode 不固定分家。
SemiAnalysis 给出的解释值得注意:生产流量里的输入长度、输出长度、缓存命中率、并发量、延迟目标每天都在变化。如果一开始就把一部分芯片固定成 Prefill 池、另一部分固定成 Decode 池,负载比例一旦偏移,就可能出现一边排队、一边空闲。更麻烦的是,Prefill 产生的大量 KV Cache 需要传给 Decode 节点,长上下文越长,这笔搬运越贵。对于强调交互延迟和能耗的系统而言,局部最优不一定等于整套集群的最优。
这种选择也反映了 OpenAI 的产品结构。ChatGPT、Codex、API 和智能体任务并不是稳定的离线批处理工作负载。用户可能突然发来 100K 上下文,也可能只问一句话;Coding Agent 会在一个会话里反复读取缓存、调用工具并继续生成。对这种负载,同质资源池更像一支可以随时调度的车队,牺牲部分理论上的阶段专用效率,换取系统层的弹性和局部性。
跑分很强,但现在还不能宣布“GPU 被打败”
SemiAnalysis 在 OpenAI 实验室使用 InferenceX 对工程样片进行过现场测试,报告称 Jalapeño 在 GPT-OSS、DeepSeek R1、Kimi K2.5 等模型上表现出很高的每瓦吞吐和低并发交互性能;在部分场景里,它的 tokens/s/MW 显著高于 GB200/GB300,对 Vera Rubin 的早期公开数字也具有竞争力。低并发 DeepSeek R1 测试中,单用户生成速度被报告为超过 700 token/s;GPT-OSS 和 Kimi K2.5 的部分配置接近 1400 token/s/user。
这些数据不能直接理解成“Jalapeño 全面领先 NVIDIA”。首先,测试主要来自 8k 输入、1k 输出这类相对容易优化的单轮工作负载,SemiAnalysis 自己也强调,尚未完成 AgentX 这种长上下文、多轮、Prefix Cache 和复杂路由压力更高的测试。其次,OpenAI 目前仍处在工程样片和软件快速 bring-up 阶段,Vera Rubin 也在早期阶段,两边的软件成熟度都在快速变化。再次,Jalapeño 是 OpenAI 自用导向的专用平台,NVIDIA GPU 面向云厂商、科研、训练、图形、HPC 和各种第三方模型,二者承担的兼容性成本并不相同。
更准确的表述是:第一代 Jalapeño 已经证明,拥有稳定大规模推理流量的模型公司,有机会用硬件/软件协同设计把 GPU 的一部分通用性成本换成更高的推理效率。它能不能成为长期平台,还要看 2027 年量产后的良率、供应链、软件兼容、模型更新速度、故障率、集群运维以及多代芯片能否连续迭代。
AI 开始参与芯片设计本身,这一点可能比跑分更重要
OpenAI 官方称,Jalapeño 从初始设计到 tape-out 只用了九个月,并使用自家模型加速部分设计与优化流程。SemiAnalysis 进一步披露,OpenAI 内部用 Codex 生成和优化底层 kernel,有些 kernel 接近数千行,软件栈还包括基于 Triton 思路扩展的 Gluon、用于验证硬件性能的模拟器,以及减少 CPU 启动开销的 megakernel 路线。OpenAI 甚至展示了 Codex 为芯片编写 Doom、流体模拟等演示程序。
这里更值得关注的是工程方法的变化。传统 ASIC 最大的问题之一,是硬件一旦定型,软件适配速度往往跟不上模型变化。模型公司却拥有一个特殊优势:它既知道下一代模型会怎么变,又拥有很强的代码生成模型,可以把大量 kernel 搜索、布局优化和验证工作自动化。过去“硬件专用化”的风险来自软件跟不上,现在 AI 有可能降低这部分适配成本。
这会改变 AI 芯片市场的竞争边界。NVIDIA 的 CUDA 仍然拥有极强生态优势,但对于每年消耗数十亿美元甚至更多推理成本的超大模型厂商,自研芯片只要节省几个百分点的电力和服务成本,就可能拥有巨大的经济价值。Google TPU、AWS Trainium、Meta MTIA、Microsoft Maia 已经说明 hyperscaler 不愿永远把全部算力利润交给 GPU 厂商。Jalapeño 进一步把这场竞争推进到“模型公司自己定义硅片”的阶段。
电力会成为下一轮推理硬件最硬的约束
SemiAnalysis 在文章里反复强调 tokens/s/MW,而不是单卡 tokens/s。这不是指标包装。大型数据中心扩容越来越受电网接入、变电设施、冷却和备用电源约束,一座已经拿到 1GW 电力配额的数据中心,无法像增加服务器那样快速再获得一个 GW。硬件每瓦能生成多少 Token,会直接影响同一电力资产能承载多少收入。
这也是为什么 Jalapeño、Rubin 以及其他推理芯片都开始把性能功耗比放到核心位置。AI 推理最终是一门大规模工业系统生意:芯片采购成本只是一部分,电力、散热、网络、机架、维护、故障恢复和模型利用率共同决定每百万 Token 的真实成本。未来比较芯片,如果只看峰值 FLOPS,很可能和只用发动机最大马力比较整车效率一样失真。
Jalapeño 当前最值得关注的结论因此并不是“OpenAI 已经击败 NVIDIA”,而是大模型推理的硬件正在从通用加速器时代进入更强的垂直协同阶段。模型结构、KV Cache、Kernel、内存拓扑、机架网络、调度系统和电力预算开始被作为一套产品共同设计。谁能长期掌握真实流量、模型路线和数据中心运行经验,谁就更有资格重新定义下一代推理芯片。
参考资料
- OpenAI, OpenAI and Broadcom unveil LLM-optimized inference chip, 2026-06-24
https://openai.com/index/openai-broadcom-jalapeno-inference-chip/ - SemiAnalysis, OpenAI Jalapeño: Better Than Nvidia Blackwell, 2026-08-25
https://newsletter.semianalysis.com/p/openai-jalapeno-better-than-nvidia - Horizon Summary, 2026-08-26
https://thysrael.github.io/Horizon/2026/08/26/summary-zh.html