ホーム / ニュース / GoogleのDiffusionGemmaはノイズからテキストを生成し、その過程で自己修正を行う
Google AI、Gemma

GoogleのDiffusionGemmaはノイズからテキストを生成し、その過程で自己修正を行う

Jun 12, 20261 分で読了
GoogleのDiffusionGemmaはノイズからテキストを生成し、その過程で自己修正を行う

ニュースサマリー

Googleは2026年6月10日(太平洋時間)、実験的なオープンウェイト言語モデル「DiffusionGemma」を発表しました。このモデルは、従来の単語ごとの生成アプローチを捨て、画像合成から借用した技術であるテキスト拡散を採用しています。これにより、最大4倍高速な出力速度を実現し、標準的な自己回帰モデルにはない組み込みの自己修正機能を可能にします。

テキスト拡散とは何か、そしてなぜ重要なのか

従来の巨大言語モデルは、自己回帰的にテキストを生成します。つまり、左から右へ一度に1つのトークンを生成し、各単語はそれ以前のすべての単語に依存します。DiffusionGemmaは根本的に異なるルートを取ります。画像生成における拡散モデルに着想を得て、ランダムノイズのブロックから始まり、複数のデノイズステップを経て、それを反復的に一貫したテキストに洗練させていきます。トークンを逐次的に確定するのではなく、モデルはブロック全体を同時に評価および修正し、出力全体にわたって双方向の情報フローを可能にします。

このアーキテクチャの変更は、速度が重要なアプリケーションに大きな影響を与えます。NVIDIA H100 1基で、DiffusionGemmaは毎秒1,000トークン以上を達成します。コンシューマーグレードのNVIDIA GeForce RTX 5090では、毎秒700トークン以上を維持します。これは、同サイズの従来の自己回帰モデルが苦戦するパフォーマンス数値です。

モデルアーキテクチャと仕様

DiffusionGemmaは、Gemma 4バックボーン、特に26B-A4B Mixture of Experts(MoE)アーキテクチャの上に構築されています。Googleのエンジニアは、このベースに拡散ヘッドを統合しました。モデルは合計260億のパラメータを持っていますが、推論中にアクティブになるのはわずか38億パラメータであり、計算要件は驚くほど控えめです。

実用的な展開のために、DiffusionGemmaは量子化時に18GBのVRAM予算に収まり、ハイエンドのコンシューマーGPUで利用可能です。モデルは256,000トークンのコンテキストウィンドウをサポートし、140以上の言語でテキスト、画像、ビデオ入力を処理できます。

モデルウェイトはApache 2.0ライセンスの下で公開されており、Hugging Faceで利用可能です。これにより、研究者や開発者はモデルを自由にダウンロード、ファインチューニング、再配布できます。

ブロック自己回帰デノイズと自己修正

DiffusionGemmaの技術的に最も興味深い機能の1つは、自己修正メカニズムです。モデルは各デノイズステップで出力ブロック全体を同時に評価するため、低信頼度のトークンを再ノイズ化して置き換えることができます。これは、すべてのトークンが一度確定され、二度と参照されない標準的な自己回帰生成ではアーキテクチャ的に不可能です。

より長い出力のために、DiffusionGemmaはブロック自己回帰デノイズを使用します。これは、256トークンのブロックを完全にデノイズし、次のブロックに進む前にキーバリューキャッシュにコミットします。この設計は、拡散の並列効率と、拡張された出力に必要な逐次的な一貫性を組み合わせています。

Uniform State Diffusionの下で、モデルは作業キャンバス全体を継続的に評価します。特定のトークンに対する信頼度が低下すると、サンプラーはそのトークンをランダムなトークンに置き換えます。これにより、別の洗練パスのために局所的なノイズが効果的に再導入されます。この反復的な自己修復により、モデルは左から右への生成で一般的な連鎖的な失敗から回復できます。

構造化推論のベンチマークとしての数独

Googleはまた、JAXの教師ありファインチューニング(SFT)レシピを使用して数独パズルでトレーニングされたDiffusionGemmaのファインチューニング済みバリアントもリリースしました。結果は、拡散モデルがタスク固有の最適化にどのように応答するかを示しています。ベースのDiffusionGemmaモデルは、パズル固有のトレーニングを受けていないため、数独パズルを約0%の成功率で解きます。キュレーションされた数独データセットでファインチューニングした後、同じモデルは80%の成功率に達します。

精度に加えて、ファインチューニングされたモデルは大幅に効率的です。ベースモデルの48ステップと比較して、約12のデノイズステップでパズルを解きます。ファインチューニングは、モデルがトークン表現を早期に安定させることを教え、デノイズループの早期停止を可能にし、レイテンシと計算コストの両方を削減します。

数独の例は、より広範なアーキテクチャ原則の明確な例として機能します。拡散フレームワークは非線形推論を可能にし、モデルは左から右へのコミットメント順序に固定されるのではなく、出力全体にわたる相互依存的な制約について同時に推論できます。このプロパティにより、拡散モデルはコード生成、構造化データ出力、論理パズルなど、強力なグローバル構造を持つタスクに特に適しています。

対象ユースケースと認識されている制限事項

Googleは、DiffusionGemmaを、速度が重要なインタラクティブなローカルワークフローに取り組む研究者や開発者向けに位置付けています。強調されているアプリケーションには、インラインコード編集、迅速なクリエイティブイテレーション、および並列レイアウトが逐次的な構成よりも利点を提供する非線形コンテンツ構造の生成が含まれます。

Googleの開発者ガイドでは、明確な品質トレードオフが認識されています。DiffusionGemmaの全体的な出力品質は、現在、自己回帰モードで動作する標準的なGemma 4よりも劣っています。このモデルは実験的なものとして説明されており、Googleは、このリリースを、テキスト拡散を実用的な生成パラダイムとしてコミュニティの理解を深めるための研究成果として位置付けています。これは、本番グレードの指示追従モデルの直接的な代替ではありません。

入手可能性とリソース

DiffusionGemmaは、Apache 2.0ライセンスの下でHugging Faceで利用可能です。Googleは、Google Developers Blogで詳細な開発者ガイドを公開しており、Google AIブログで紹介記事も公開しています。コミュニティによって維持されているローカルランナーも、クラウド依存なしにモデルを完全にオフラインで実行したい開発者向けに利用可能です。

このリリースは、自己回帰デコーディングの代替手段を模索する広範な研究トレンドを反映しています。ARモデルは本質的に逐次的にデコードするため、推論時の並列化が困難です。拡散ベースの生成は、構造的に異なるパスを提供します。これは、計算量がデノイズステップの数に比例し、出力長に比例するのではなく、各ステップ内でグローバルな一貫性が達成できるパスです。

Google AI、Gemma