OpenAI 的 GPT-5.6 Sol 推出全新 Ultrafast 模式,運行速度提升 14 倍

新聞摘要
OpenAI 於 2026 年 8 月 13 日(太平洋時間)發布了 Ultrafast 預覽版,這是其 GPT-5.6 Sol 模型的全新推論層級,運行速度比該模型的標準處理模式快高達 14 倍,輸出速度最高可達每秒 750 個 token。這個新層級由 Cerebras Systems 的硬體驅動,目前正透過 OpenAI API 優先向有限數量的客戶推出,預計隨著運算資源擴充將逐步擴大存取範圍。
Ultrafast 帶來的改變
過去,開發者若需要大型語言模型提供近乎即時的回應,往往必須降級使用較小或更專門化的模型,以犧牲推理品質來換取速度。OpenAI 表示 Ultrafast 打破了這種取捨:在 Ultrafast 模式下運行的 GPT-5.6 Sol 保留了與 GPT-5.6 Sol 標準版相同的底層智慧,同時生成速度大幅提升。OpenAI 將此定位為轉向「每秒完成更多有效工作」,而不僅僅是更快的聊天機器人體驗。
速度背後的硬體支援
效能的提升源自 Cerebras 的晶圓級引擎架構。不同於傳統基於 GPU 的推論方式必須不斷在晶片內記憶體與晶片外儲存空間之間搬移模型權重,Cerebras 的晶圓尺寸晶片能將完整的權重集保留在晶片上,每片晶圓約配備 44 GB 的 SRAM。Cerebras 在同日發布的部落格文章中指出,這種設計消除了記憶體頻寬瓶頸,而該瓶頸通常會限制前沿規模模型在標準 GPU 集群上的文字生成速度。Cerebras 也透過 GlobeNewswire 發布的另一份新聞稿證實了此次合作關係,並形容 Ultrafast 證明了前沿級別的智慧與即時速度不再互斥。
預覽可用性與推出計畫
Ultrafast 目前僅限於小範圍預覽。OpenAI 尚未透露首批客戶群的確切規模,僅表示隨著基礎設施容量增長,存取權限將逐步擴大。此次推出始於 OpenAI API 而非面向消費者的 ChatGPT 介面,顯示初期重點在於服務開發對延遲敏感的應用程式的開發者,而非一般的日常聊天用途。
定價
截至本報導為止,OpenAI 尚未公布 Ultrafast 請求的獨立價格。透過 API 使用標準版 GPT-5.6 Sol 的價格維持在每百萬輸入 token 5 美元及每百萬輸出 token 30 美元;OpenAI 尚未說明 Ultrafast 是否會在這些費率基礎上收取額外費用。
潛在應用場景
OpenAI 指出了幾類最能受益於亞秒級、高吞吐量生成的工作負載:需要即時摘要並對資訊採取行動的事件回應系統、處理即時對話的客服與支援工具、依賴快速周轉的金融市場分析,以及電子商務應用(如即時產品推薦或結帳輔助)。在各種情況下,其核心訴求都是更快的生成速度能讓更複雜的多步驟 AI 工作流程在即時應用程式所需的延遲預算內順利運行。
產業背景
這項發布延續了產業界將前沿語言模型與專用推論硬體相結合以降低延遲的廣泛趨勢,此前 AI 實驗室與晶片製造商(如 Cerebras 和 Groq)已有類似聚焦速度的合作案例。包括 TechCrunch 和 9to5Mac 在內的媒體在報導中指出,在模型智慧相當的情況下實現 14 倍的速度倍增,標誌著主要 AI 實驗室迄今在 2026 年所揭露的最顯著吞吐量躍升之一。