2026 年 6 月 10 日,Google 把一款名叫 DiffusionGemma 的模型权重放到了 Apache 2.0 协议下——这是迄今最强的「扩散语言模型」开源版本。它的卖点不是参数更大——26B 的体量在当下并不夸张——而是把图像 AI 里那个「从噪声里擦出图像」的方法,借到了文字生成上。结果是:在一块 H100 上跑出 1000+ tokens/秒、在 RTX 5090 上跑 700+ tokens/秒,本地推理相比传统自回归大模型最快 提升 4 倍。
一、从「打字机」到「印刷机」
过去十年的大型语言模型,无论是闭源旗舰还是开源的 Llama、Qwen、Gemma 系列,本质上都是自回归——一个字接一个字地「打」。每生成下一个字,都要回头看一眼已经写好的所有字,串行地跑过一遍注意力机制。这种方式的好处是文本质量稳定,但代价也明显:算力瓶颈卡在显存带宽,单卡消费级 GPU 跑 26B 模型往往只能「勉强蹦字」。
DiffusionGemma 换了一条路:它一次先「铺」出 256 个 token 的噪声画布,然后多轮迭代把噪声「擦掉」,让一段文字以并行的方式浮现。这正是图像生成里扩散模型的做法,移植到文本后,最大变化就是——决定速度的不再是「读一个字有多慢」,而是「GPU 一次能做多少并行算术」。
二、4 倍提速是怎么来的
DiffusionGemma 的架构是 26B 总参数、激活 3.8B 的混合专家(MoE)。模型权重里有 26B 个参数,但每个 token 实际只激活约 3.8B,这部分参数仍然走双向注意力,但一次性处理的「画布」扩展到了 256 个位置。Google 在博客里给出的实测:
- NVIDIA H100:1000+ tokens/秒
- RTX 5090:700+ tokens/秒
- 低到中等 batch 下,相对同尺寸自回归 Gemma 4,本地推理速度最高提升约 4 倍
但 Google 自己也强调,这个倍数只在「低并发、单卡本地」场景成立。高并发云端推理,自回归模型依然是吞吐量的赢家——一块 H100 同时给一百个用户写答案时,逐字生成反而能把 GPU 算力「压满」。
三、被忽略的批评:那些 token 是「真」并行的吗
6 月 12 日,独立研究团队把 DiffusionGemma 26B 的采样器插了桩,记录每个 token 实际 commit 的顺序和置信度,结果发在 arXiv 2606.14620。这篇报告没有推翻 4 倍提速,但给出了一个冷静的注脚:
模型的解码既不是完全并行,也不是完全顺序。它呈一种「局部从左到右」的偏向,强弱完全取决于你以多粗的粒度去看。「块大小」更像是一把测量尺的产物,而不是架构的硬性事实。
简单说:当你把 256 个 token 一次性「印」出来时,肉眼看上去是同步的,但在 token 级别的微观尺度上,仍然存在弱序——某些位置会先被「擦干净」。尤其是面对结构化 JSON 输出时,commit 顺序基本是任意的;而在数学推理里,commit 置信度还能预测正误,到了事实性问答则完全失去信号。
四、巨头跟进:扩散思路被正式拉进主战场
行业跟进速度很快。2026 年 7 月 7 日,NVIDIA 在 arXiv 公开了 Nemotron-Labs-Diffusion,把「自回归 + 扩散 + 自推测解码」三种模式塞进同一套架构,能在不同并发场景下切换模式。实测中,8B 尺寸的扩散-自回归混合模型在 GB200 上比 Qwen3-8B 每前向多解码 6 倍 token,SPEED-Bench 吞吐量领先约 4 倍。
这条线的意义是:扩散不再是「实验性小众玩法」,主流大厂开始为它单独写训练目标、做推理基础设施,甚至把它列为下一代语言模型的标准范式之一。
五、未解的问题
几个仍然没有确定答案的开放问题:
- 质量的代价。Google 自己承认,DiffusionGemma 整体输出质量低于标准 Gemma 4,更像是「速度敏感场景」的专用工具,能不能当通用替代品尚无定论。
- 长文本一致性。当「画布」扩到 1024、2048 token,扩散方式还能否保持段落级别的逻辑连贯,目前公开评测不多。
- 训练成本。把双向注意力 + 多轮去噪加进训练目标,所需的算力和数据量没有完整披露,复现门槛未知。
看起来,文本生成正从「一个字一个字敲出来」过渡到「一整段一整段印出来」。但那段被同步印刷出来的文字里,仍然藏着我们没完全看清的顺序。
资料来源:Google 官方博客、arXiv 2606.14620、arXiv 2607.05722(NVIDIA)。如有科学错误欢迎指正。