首頁 / 資訊 / OpenAI 的 Jalapeño 晶片在首批基準測試中將 AI 延遲最多降低 3.6 倍
OpenAI

OpenAI 的 Jalapeño 晶片在首批基準測試中將 AI 延遲最多降低 3.6 倍

2026年8月26日5 分鐘閱讀
OpenAI 的 Jalapeño 晶片在首批基準測試中將 AI 延遲最多降低 3.6 倍

新聞摘要

OpenAI 公布了為 Jalapeño 所進行的首批獨立基準測試結果,這款晶片是該公司與 Broadcom 共同開發的客製化 AI 推論晶片,數據顯示其在執行真實世界語言模型工作負載時,速度比同級商用 GPU 配置更快,耗電也更低。這份於美東時間 2026 年 8 月 25 日下午 3 點發布的數據,是 OpenAI 首次以第三方測試資料、而非內部預估,來佐證先前對這款晶片的效能說法。

基準測試測量了什麼

OpenAI 讓 Jalapeño 執行 SemiAnalysis 的 InferenceX 基準測試套件,這是一套廣為使用的獨立測試框架,用於在貼近真實的推論工作負載上比較 AI 加速器,而非只看合成的峰值吞吐量數字。測試涵蓋三款開放權重的語言模型,分別代表不同規模與使用情境:GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T。

這套測試並非只鎖定單一指標,而是測量晶片在整個推論流程中的表現,包括模型處理輸入提示詞的預填階段,以及產生回應的逐字生成階段。OpenAI 表示,這種雙重關注反映了晶片實際的工程設計方向:減少往往成為真實部署瓶頸的資料搬移與通訊延遲,而不只是在單一排行榜指標上衝高分數。

主要效能數據

根據已公布的結果,Jalapeño 的端到端回應延遲比執行相同模型的標準商用 GPU 部署快了 1.7 至 3.6 倍。在電源效率方面,這款晶片在峰值容量下,每瓦電力完成的總工作量多出 1.5 至 1.9 倍。針對需要連續快速執行多個步驟的互動式低延遲工作負載,例如 AI 代理,OpenAI 回報的表現比同級配置高出 2.1 至 4.1 倍。

在一項更具體的正面對比中,OpenAI 與 Broadcom 表示,Jalapeño 的額定熱設計功耗為 700 瓦,表現勝過額定功耗約為其兩倍的 Nvidia GB300 旗艦 GPU。在這項比較中,Jalapeño 每消耗一千瓦電力所產出的吞吐量最多高出 1.9 倍,延遲則最多降低 3.6 倍。值得注意的是,OpenAI 表示這款晶片在測試期間的實際功耗維持在 550 瓦以下,低於其額定上限。

OpenAI 為何自研晶片

Jalapeño 是 OpenAI 的第一款客製化晶片,從一開始就設計為專用推論加速器,而非將訓練晶片改作他用,也不是通用處理器。OpenAI 與 Broadcom 於美東時間 2026 年 6 月 24 日首次公開這款晶片,表示它從初步設計到製造下線僅耗時約九個月,兩家公司稱這是此複雜度晶片所達成的最快開發週期之一。當時,Broadcom 的管理層也指出,與用於推論的典型通用 GPU 相比,其營運成本大幅降低。

這項計畫背後的理由很直接:隨著 AI 公司擴大聊天機器人與代理產品,以即時回應數百萬名使用者,推論——也就是執行已訓練好的模型來回答查詢——所耗費的成本與能源,在總支出中所占的比重,已經超過訓練模型的一次性成本。一款專為推論工作負載調校的晶片,而非還必須兼顧訓練的通用加速器,原則上可以在它需要執行的特定工作上更有效率。

接下來會如何

OpenAI 已表示,Jalapeño 仍處於早期測試階段,並計劃於 2027 年在自家基礎設施中擴大部署。該公司尚未透露哪些具體產品或服務會率先採用這款晶片,也未詳細說明製造數量。目前,新公布的基準測試數據主要作為一種驗證,證明這款晶片在獨立測試下的真實效能,而非僅由 OpenAI 自家行銷資料描述,確實符合該公司在計畫首次公布時所設定的效率與延遲目標。

對 AI 產業更廣泛的意義在於,OpenAI 加入了少數幾家主要 AI 開發商的行列,與 Google、Amazon 等公司一樣,開始設計自家的推論晶片,而非完全依賴商用晶片製造商的現成 GPU。追蹤此領域的分析師指出,如果 Jalapeño 的效率優勢能在規模化後維持,將有望顯著降低為數百萬同時上線使用者執行大型語言模型的成本,而這項成本已成為 AI 助理與代理能多廣泛部署的核心限制之一。

OpenAIAI 晶片