Google 的 TurboQuant 突破AI記憶體限制 — 6倍壓縮、零準確度損失、無需重新訓練

新聞摘要
Google Research 於 2026 年 3 月 25 日(美國東部時間)星期二正式發布了 TurboQuant,這是一種下一代壓縮演算法,旨在大幅減少大型語言模型的記憶體佔用空間,且不犧牲任何精確度。這項發布於 Google Research 部落格上,預計將於下個月在巴西里約熱內盧舉行的國際學習表徵會議 (ICLR 2026) 上正式發表。
什麼是 TurboQuant?
TurboQuant 是一種兩階段向量量化壓縮方法,旨在解決現代 AI 推理中最持久的瓶頸之一:鍵值 (KV) 快取。這是大型語言模型在處理摘要、問答和程式碼生成等長上下文任務時所依賴的「工作記憶體」。透過將此快取壓縮至少 6 倍,TurboQuant 使 AI 系統能夠以更快的速度、更低的成本和更大的規模運行,而且無需進行任何模型重新訓練或微調。
TurboQuant 背後的兩項核心技術
TurboQuant 透過 Google Research 開發的兩項新穎、互補的方法實現了卓越的效率。
第一項技術 PolarQuant 重新構想了向量資料的幾何儲存方式。PolarQuant 不依賴標準的笛卡爾座標,而是將資料向量轉換為極座標形式,在隨機旋轉後將它們映射到固定的圓形網格上。由於轉換後角度的分佈變得高度可預測,該系統無需儲存昂貴的正規化常數,從而顯著降低了記憶體開銷。
第二項技術 量化 Johnson-Lindenstrauss (QJL) 則充當數學誤差檢查器。即使經過 PolarQuant 壓縮,仍會殘留少量誤差。QJL 對這些剩餘資料應用 1 位元校正層,消除了量化偏差,確保注意力分數保持準確。其結果是近乎無損的壓縮流程,僅增加微不足道的運行時間開銷。
令業界震驚的效能結果
Google 在 Gemma 和 Mistral 等開源模型上進行的內部基準測試,針對具挑戰性的長上下文任務,取得了令人印象深刻的結果。TurboQuant 成功將 KV 快取量化至僅 3 位元,記憶體使用量減少了至少 6 倍,並且在所有測試的基準測試中,包括 LongBench、Needle In A Haystack、ZeroSCROLLS、RULER 和 L-Eval,準確度均無損失。
或許最引人注目的是原始速度的提升:在 NVIDIA H100 GPU 加速器上,TurboQuant 的 4 位元實作與 32 位元未量化金鑰相比,在計算注意力 logits 方面提供了 8 倍的效能提升。獨立的社群研究人員在宣布後 24 小時內就重現了類似的結果,Qwen3.5-35B 模型上的早期基準測試顯示,在 8,500 到 64,000 個 token 的上下文長度範圍內,有 100% 的完全匹配。
市場反應:記憶體晶片股受挫
此消息的連鎖反應立即在華爾街引起反響。在 Google 於週二(美國東部時間)發布消息後,包括美光、SK 海力士、三星電子和 Western Digital 在內的主要記憶體半導體公司的股價均明顯下跌,分析師開始重新評估對高頻寬記憶體 (HBM) 長期需求的假設。其邏輯很簡單:如果 AI 公司僅透過軟體創新就能將記憶體需求減少六倍,那麼對昂貴硬體升級的需求可能會大大減緩。
然而,一些分析師迅速指出,TurboQuant 僅針對推理記憶體,而非訓練,而訓練工作負載持續需要大量的 RAM,這使得長期晶片需求前景變得不明朗。
「Google 的 DeepSeek 時刻」
科技界對此反應不一,既有敬畏也有興奮。Cloudflare 執行長 Matthew Prince 將 TurboQuant 與 DeepSeek 的效率突破相提並論,稱之為「Google 的 DeepSeek 時刻」。Google Research 的原始發布在 24 小時內在 X(前身為 Twitter)上獲得了超過 770 萬次的觀看次數,社群開發者爭相將該演算法移植到流行的本地 AI 框架,如適用於 Apple Silicon 的 MLX 和 llama.cpp。
網路也迅速捕捉到與 HBO 電視劇《矽谷》中虛構的壓縮新創公司 Pied Piper 的比較,指出 TurboQuant 極致的近乎無損壓縮,幾乎正是該劇所戲劇化的突破。
對 AI 產業的意義
TurboQuant 的發布標誌著 2026 年 AI 發展方向的一個關鍵信號。Google 並非一味追求需要更多運算能力、越來越大的模型,而是展示了數學的優雅和演算法的創新可以帶來顯著的效率提升。這項技術對於需要龐大、可搜尋且持久的向量記憶體來處理複雜的多步驟任務的新興代理式 AI 系統時代尤其有前景。
至關重要的是,TurboQuant 是在開放研究框架下發布的,這意味著開發人員和公司可以開始將其原理整合到自己的系統中。然而,這仍然是一項實驗室的突破,大規模的全面生產部署仍是下一步,整個產業將密切關注。