谷歌的DiffusionGemma从噪声中生成文本——并在此过程中进行自我纠正

新闻摘要
Google 于 2026 年 6 月 10 日(太平洋时间)发布了 DiffusionGemma,这是一个实验性的开源权重语言模型,它摒弃了传统的逐字生成方法,转而采用文本扩散技术——一种借鉴自图像合成的技术——从而将输出速度提高了四倍,并实现了标准自回归模型所不具备的内置自我纠错能力。
什么是文本扩散及其重要性
传统的语言模型以自回归的方式生成文本:一次生成一个 token,从左到右,每个词都依赖于之前的所有词。DiffusionGemma 采取了根本不同的路线。受图像生成中扩散模型的启发,它从一团随机噪声开始,并通过多个去噪步骤将其逐步提炼成连贯的文本。模型不是依次确定每个 token,而是同时评估和修改整个文本块,从而使信息能够跨输出双向流动。
这种架构的转变对速度至关重要的应用具有重要意义。在单个 NVIDIA H100 上,DiffusionGemma 的速度超过 1000 个 token/秒。在消费级 NVIDIA GeForce RTX 5090 上,其速度可达 700 多个 token/秒——这个性能水平是同等规模的传统自回归模型难以企及的。
模型架构和规格
DiffusionGemma 构建在 Gemma 4 主干之上,特别是 26B-A4B 专家混合(MoE)架构。Google 的工程师在此基础上集成了一个扩散头。虽然模型总共有 260 亿个参数,但在推理过程中仅激活 38 亿个参数,计算需求出奇地适中。
对于实际部署,量化后的 DiffusionGemma 可容纳在 18 GB 的 VRAM 中,使其可以在高端消费级 GPU 上运行。该模型支持 256,000 个 token 的上下文窗口,并能处理超过 140 种语言的文本、图像和视频输入。
模型权重根据 Apache 2.0 许可证发布,可在 Hugging Face 上获取,允许研究人员和开发人员自由下载、微调和重新分发模型。
块自回归去噪和自我纠错
DiffusionGemma 最具技术吸引力的功能之一是其自我纠错机制。由于模型在每个去噪步骤中同时评估整个输出块,因此它可以在精炼过程中重新噪声化并替换低置信度的 token——这在标准的自回归生成中是架构上不可能实现的,因为每个 token 一旦确定就无法再次访问。
对于较长的输出,DiffusionGemma 使用块自回归去噪:它完全去噪一个 256 个 token 的块,并将其提交到键值缓存,然后再处理下一个块。这种设计将扩散的并行效率与扩展输出所需的顺序连贯性结合起来。
在统一状态扩散下,模型会持续评估其整个工作画布。当某个 token 的置信度下降时,采样器会用随机 token 替换该 token——有效地重新引入局部噪声以进行另一次精炼。这种迭代式自我修复使模型能够从早期错误中恢复,而不会像从左到右生成那样出现级联故障。
数独作为结构化推理的基准
Google 还发布了一个 DiffusionGemma 的微调变体,该变体使用 JAX 中的监督微调(SFT)方法在数独谜题上进行了训练。结果说明了扩散模型如何响应任务特定的优化。基础 DiffusionGemma 模型在解决数独谜题方面的成功率约为 0%,因为它没有接受任何特定于谜题的训练。在经过精选的数独数据集上微调后,同一模型达到了 80% 的成功率。
除了准确性,微调模型还大大提高了效率。它大约需要 12 个去噪步骤来解决谜题,而基础模型需要 48 个步骤。微调教会模型更早地稳定其 token 表示,从而能够提前停止去噪循环,降低延迟和计算成本。
数独示例清晰地说明了一个更广泛的架构原则:扩散框架支持非线性推理,模型可以同时推理整个输出中的相互依赖的约束,而不是被锁定在从左到右的确定顺序中。这一特性使得扩散模型特别适合具有强大全局结构的任务,例如代码生成、结构化数据输出和逻辑谜题。
目标用例和已承认的局限性
Google 将 DiffusionGemma 定位为面向研究人员和开发人员,用于处理速度至关重要、交互式本地工作流程。重点介绍的应用包括内联代码编辑、快速创意迭代以及生成并行布局优于顺序组合的非线性内容结构。
Google 的开发者指南承认了一个明显的质量权衡:DiffusionGemma 的整体输出质量目前低于标准 Gemma 4 在自回归模式下的输出质量。该模型被描述为实验性的,Google 将此次发布视为一项研究成果,旨在增进社区对文本扩散作为一种可行生成范式的理解——而不是直接替代生产级指令遵循模型。
可用性和资源
DiffusionGemma 可在 Hugging Face 上根据 Apache 2.0 许可证获取。Google 在 Google 开发者博客上发布了详细的开发者指南,并在 Google AI 博客上发布了介绍性文章。还有一个社区维护的本地运行器可供希望完全离线运行模型的开发人员使用,无需任何云依赖。
此次发布反映了探索自回归解码替代方案的更广泛研究趋势。由于 AR 模型本质上是顺序解码的,因此在推理时难以并行化。基于扩散的生成提供了一条结构上不同的路径——计算量与去噪步骤的数量成正比,而不是输出长度,并且可以在每个步骤内实现全局连贯性。