首頁 / 資訊 / Google 將其 AI 晶片一分為二:TPU 8t 和 8i 如何為代理時代而生
AI 晶片,雲端基礎設施

Google 將其 AI 晶片一分為二:TPU 8t 和 8i 如何為代理時代而生

Apr 23, 20261 分鐘閱讀
Google 將其 AI 晶片一分為二:TPU 8t 和 8i 如何為代理時代而生

新聞摘要

在 2026 年 Google Cloud Next 大會(4 月 22 日至 24 日,拉斯維加斯,太平洋標準時間)上,Google 發表了第八代 Tensor 處理單元(TPU),推出了兩款專用晶片 — TPU 8t 用於 AI 模型訓練,TPU 8i 用於推論 — 這標誌著 Google 首次將這些工作負載劃分為不同的架構。TPU 8t 的計算效能接近其前代的 3 倍,而 TPU 8i 則專為代理式和多步驟 AI 工作流程的超低延遲而設計。這兩款晶片均作為 Google 更廣泛的 AI Hypercomputer 平台的一部分,預計將於 2026 年稍晚全面上市。

代理時代的新架構

Google 將其第八代 TPU 分割為兩個專用處理器的決定,反映了 AI 基礎設施設計方式的根本性轉變。十多年來,單一 TPU 同時處理了訓練大型模型的密集計算以及為終端用戶提供這些模型的持續工作。隨著 AI 系統從簡單的問答工具演變成能夠執行複雜工作流程的自主、多步驟代理,訓練和推論的效能要求已顯著分歧。Google 工程師與 Google DeepMind 緊密合作,得出結論認為單一統一的設計已無法以最高的效率同時滿足這兩組需求。

TPU 8t:訓練的強大引擎

TPU 8t 專為高吞吐量的 AI 模型訓練而建。每個超級叢集(superpod)匯集了 9,600 個晶片,提供 121 exaflops 的計算能力和 2 petabytes 的共享記憶體,透過高速晶片間互連(ICI)連接。這種配置即使對於最複雜的模型架構,也能實現近乎線性的擴展。根據 Google 的官方公告(發布於 2026 年 4 月 22 日星期三,太平洋標準時間),該晶片提供的性價比約為前代第七代 Ironwood TPU 的 2.8 倍,並能將先前需要數月訓練時間壓縮到數週。Google 表示,在其最大部署規模下,它可以使用其 Pathways 和 JAX 軟體系統在單一叢集中協調超過一百萬個 TPU 8t 晶片。

TPU 8i:專為推論和推理設計

TPU 8i 針對快速增長的推論市場,該市場要求已部署的 AI 模型必須以低延遲同時回應數百萬個用戶請求。一個關鍵的架構特點是其使用了晶片上的靜態隨機存取記憶體(SRAM):每個 TPU 8i 包含 384MB 的 SRAM,是 Ironwood 代的兩倍。這個大型 SRAM 緩衝區允許晶片將模型權重和中間計算保留在計算核心附近,從而顯著減少記憶體存取瓶頸。Google 表示,TPU 8i 的每美元效能比其前代產品提高了 80%,並且專門設計用於支援專家混合(MoE)模型和強化學習(RL)任務 — 這些能力是下一代 AI 推理系統的基礎。

AI Hypercomputer 和生態系統整合

這兩款晶片都整合到 Google 的 AI Hypercomputer 中,這是一個統一的基礎設施堆疊,結合了專用硬體、開放軟體框架和靈活的雲端消費模式。該平台還整合了新的 Axion 驅動的 N4A CPU 執行個體,Google 表示,與競爭對手的超大規模雲端服務相比,其代理執行時間工作負載的性價比提高了 30%。AI Hypercomputer 是驅動 Google 自家 Gemini 模型系列和企業 AI 服務的相同基礎。Google 還宣布與晶片設計合作夥伴 Broadcom 和 Marvell Technology 進行持續合作,以擴展其矽供應鏈,確保基礎設施能夠擴展到數吉瓦的容量級別。

日益增長的企業採用

在這一代產品推出之前,Google 的 TPU 平台採用率已顯著擴大。Citadel Securities 在 Google TPU 上建構了量化研究軟體,並且美國能源部所有 17 個國家實驗室都使用在該平台上運行的 AI 協同科學家軟體。Anthropic 已承諾從 Google Cloud 消耗數吉瓦的 TPU 容量。據 The Information 在 2026 年 2 月報導,Meta 也簽署了一項多年、數十億美元的 TPU 存取協議。這些合作夥伴關係凸顯了隨著企業加速大規模部署 AI,Google 自訂矽策略背後的商業動能日益增強。

AI 晶片,雲端基礎設施