Google 的 DiffusionGemma 從雜訊生成文字 — 並在過程中自我修正

新聞摘要
Google 於太平洋時間 2026 年 6 月 10 日發布了 DiffusionGemma,這是一個實驗性的開放權重語言模型,它摒棄了傳統的逐字生成方法,轉而採用文本擴散技術——一種借鑒自圖像合成的技術——可將輸出速度提高四倍,並具備標準自迴歸模型所沒有的內建自我修正功能。
什麼是文本擴散及其重要性
傳統的大型語言模型以自迴歸方式生成文本:一次一個 token,從左到右,每個單詞都依賴於之前的所有單詞。DiffusionGemma 採取了根本不同的路線。受圖像生成中擴散模型的啟發,它從一塊隨機噪聲開始,並在多個去噪步驟中將其逐步細化為連貫的文本。該模型不是依次確定每個 token,而是同時評估和修改整個區塊,使信息能夠在輸出中雙向流動。
這種架構的轉變對速度至關重要的應用具有重大意義。在單個 NVIDIA H100 上,DiffusionGemma 的速度超過每秒 1,000 個 token。在消費級 NVIDIA GeForce RTX 5090 上,它能維持每秒 700 多個 token 的速度——這個性能數字是同等規模的傳統自迴歸模型難以匹敵的。
模型架構與規格
DiffusionGemma 建構在 Gemma 4 主幹之上,特別是 26B-A4B 混合專家 (MoE) 架構。Google 的工程師在此基礎上整合了一個擴散頭。雖然該模型總共有 260 億個參數,但在推理過程中僅激活 38 億個參數,使得計算需求出奇地適中。
對於實際部署,DiffusionGemma 在量化後可容納於 18 GB 的 VRAM 預算內,使其能夠在高端消費級 GPU 上運行。該模型支援 256,000 個 token 的上下文窗口,並能處理超過 140 種語言的文本、圖像和影片輸入。
模型權重根據 Apache 2.0 授權發布,並可在 Hugging Face 上取得,研究人員和開發人員可以自由下載、微調和重新分發該模型。
區塊自迴歸去噪與自我修正
DiffusionGemma 最具技術吸引力的功能之一是其自我修正機制。由於模型在每個去噪步驟中同時評估整個輸出區塊,因此它可以在細化過程中重新噪化並替換低信賴度的 token——這在標準自迴歸生成中是架構上不可能實現的,因為每個 token 一旦確定就無法再次訪問。
對於較長的輸出,DiffusionGemma 使用區塊自迴歸去噪:它會完全去噪一個 256 個 token 的區塊,並將其提交到鍵值快取,然後再處理下一個區塊。這種設計結合了擴散的並行效率和擴展輸出所需的順序連貫性。
在統一狀態擴散 (Uniform State Diffusion) 下,模型會持續評估其整個工作畫布。當特定 token 的信賴度下降時,取樣器會用隨機 token 替換該 token——有效地重新引入局部噪聲以進行另一次細化。這種迭代式自我修復使模型能夠從早期錯誤中恢復,而不會像從左到右生成那樣出現級聯故障。
數獨作為結構化推理的基準
Google 還發布了一個 DiffusionGemma 的微調變體,該變體使用 JAX 中的監督式微調 (SFT) 配方,在數獨謎題上進行了訓練。結果說明了擴散模型如何響應任務特定的優化。基礎 DiffusionGemma 模型在解決數獨謎題方面的成功率約為 0%,因為它沒有接收任何謎題特定的訓練。在經過精心策劃的數獨數據集上進行微調後,同一模型達到了 80% 的成功率。
除了準確性之外,微調模型還顯著提高了效率。它大約需要 12 個去噪步驟來解決謎題,而基礎模型需要 48 個步驟。微調教會模型更早地穩定其 token 表示,從而能夠提前停止去噪循環,降低延遲和計算成本。
數獨範例清楚地說明了一個更廣泛的架構原則:擴散框架能夠實現非線性推理,模型可以同時推理整個輸出中相互依賴的約束,而不是被鎖定在從左到右的確定順序中。這種特性使得擴散模型特別適合具有強全局結構的任務,例如程式碼生成、結構化數據輸出和邏輯謎題。
目標使用案例與已承認的限制
Google 將 DiffusionGemma 定位為速度至關重要的、互動式本地工作流程的研究人員和開發人員使用。重點應用包括內嵌程式碼編輯、快速創意迭代以及生成非線性內容結構,其中並行佈局優於順序組合。
Google 的開發者指南承認存在明顯的品質權衡:DiffusionGemma 的整體輸出品質目前低於標準 Gemma 4 以自迴歸模式運行的品質。該模型被描述為實驗性的,Google 將此次發布視為一項研究成果,旨在增進社群對文本擴散作為可行生成範式的理解——而不是直接取代生產級的指令遵循模型。
可用性與資源
DiffusionGemma 根據 Apache 2.0 授權在 Hugging Face 上提供。Google 在 Google 開發者部落格上發布了詳細的開發者指南,並在 Google AI 部落格上發布了入門文章。對於希望完全離線運行模型而無需任何雲端依賴的開發者,還提供了一個社群維護的本地運行器。
此次發布反映了探索自迴歸解碼替代方案的更廣泛研究趨勢。由於自迴歸模型本質上是順序解碼的,因此在推理時難以進行並行處理。基於擴散的生成提供了一條結構上不同的路徑——計算量與去噪步驟的數量成正比,而不是輸出長度,並且在每個步驟內都可以實現全局連貫性。