OpenAI 的 Jalapeño 芯片在首批基准测试中将 AI 延迟最多降低 3.6 倍

新闻摘要
OpenAI 公布了 Jalapeño 的首批独立基准测试结果。这款芯片是 OpenAI 与博通联合开发的定制 AI 推理芯片,数据显示它在运行真实语言模型工作负载时,比同类商用 GPU 方案速度更快、功耗更低。这些数据于 2026 年 8 月 25 日美国东部时间下午 3 点发布,标志着 OpenAI 首次用第三方测试数据而非内部预测来支撑其此前关于该芯片的性能说法。
基准测试测了什么
OpenAI 让 Jalapeño 运行了 SemiAnalysis InferenceX 基准测试套件。这是一套独立测试框架,广泛用于在真实推理工作负载而非合成的峰值吞吐量数字上比较 AI 加速器。测试覆盖了三个开放权重语言模型,分别代表不同规模和用例:GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。
该套件并非只测单一指标,而是衡量芯片在整个推理流水线上的表现,包括模型处理输入提示的预填充阶段,以及生成回复的令牌生成阶段。OpenAI 表示,这种双重关注正反映了该芯片的实际工程设计思路:减少往往成为真实部署瓶颈的数据移动和通信延迟,而不仅仅是在某个单一榜单指标上刷出高分。
主要性能数据
根据已公布的结果,Jalapeño 的端到端响应延迟比运行相同模型的标准商用 GPU 部署快 1.7 到 3.6 倍。在能效方面,该芯片在峰值容量下每瓦电力完成的总工作量多出 1.5 到 1.9 倍。对于需要按顺序快速执行大量步骤的交互式低延迟工作负载(例如 AI 智能体),OpenAI 报告其性能比同类方案提升 2.1 到 4.1 倍。
在一项更具体的正面对比中,OpenAI 和博通表示,额定热设计功耗为 700 瓦的 Jalapeño,超过了英伟达旗舰 GPU GB300——后者的额定功耗大约是前者的两倍。在这项对比中,Jalapeño 每消耗一千瓦电力可提供的吞吐量最多高出 1.9 倍,延迟最多低 3.6 倍。值得注意的是,OpenAI 表示该芯片在测试期间的实际功耗保持在 550 瓦以下,低于其额定上限。
OpenAI 为什么要自研芯片
Jalapeño 是 OpenAI 的首款定制芯片,从一开始就被设计为专用的推理加速器,而非改造而来的训练芯片或通用处理器。OpenAI 和博通于 2026 年 6 月 24 日美国东部时间首次发布该芯片,称其从初始设计到制造流片仅用了约九个月,两家公司称这一速度是同等复杂度芯片中实现过的最快开发周期之一。当时,博通管理层还指出,与用于推理的典型通用 GPU 相比,其运营成本大幅降低。
该项目背后的逻辑很直接:随着 AI 公司扩大聊天机器人和智能体产品的规模,需要实时响应数百万用户,推理(即运行已训练好的模型来回答问题)所消耗的成本和能源在总支出中的占比,已经超过了训练模型的一次性成本。一款专门针对推理工作负载调优的芯片,相比还必须兼顾训练的通用加速器,原则上可以在它需要完成的具体任务上做到更高效。
接下来会发生什么
OpenAI 已表示,Jalapeño 仍处于早期测试阶段,计划于 2027 年在其基础设施中扩大部署。该公司尚未透露哪些具体产品或服务将率先运行在该芯片上,也未披露制造量详情。目前,新公布的基准数据主要起到验证作用:证明该芯片在独立测试而非仅靠 OpenAI 自身营销材料描述下的真实性能,与公司在项目首次公布时设定的效率和延迟目标相符。
对 AI 行业而言,更广泛的意义在于,OpenAI 加入了谷歌和亚马逊等少数几家主要 AI 开发者的行列,开始设计自己的推理芯片,而不是仅仅依赖商用芯片厂商的现成 GPU。追踪该领域的分析师指出,如果 Jalapeño 的效率优势能在规模化部署中得到保持,它有望显著降低为数百万并发用户运行大语言模型的成本——这一成本已成为 AI 助手和智能体能够多广泛部署的核心制约因素之一。