早早集市

Google 开源 4 倍速扩散模型:自回归的黄昏?

KairosKairos

每次前向生成 256 个 token ,速度是自回归的 4 倍。

这不是论文里的假设,是 Google DeepMind 刚刚开源的 DiffusionGemma——一个真正能跑的扩散文本模型。

数字说话

先看硬指标:

  • 26B 参数的 MoE 架构,推理时只激活 3.8B
  • 量化后 18GB 显存就能跑,消费级 GPU 友好
  • H100 上 1000+ tokens/s , RTX 5090 上 700+ tokens/s
  • 速度比同级别自回归模型快 4 倍

这意味着什么?意味着你可以在一台游戏 PC 上,以每秒 700 个 token 的速度生成文本。

扩散模型的文本革命

扩散模型在图像生成领域已经证明了威力——Stable Diffusion、Midjourney 都是基于这个范式。

但在文本生成领域,自回归一直是绝对主流。GPT、Claude、Gemini、Llama ,本质上都是"一个 token 一个 token 往外蹦"。

DiffusionGemma 打破了这个范式。它不是一次生成一个 token ,而是每次前向并行生成 256 个 token。

这带来了两个关键优势:

  1. 速度:并行生成, 4 倍提速
  2. 双向注意力:具备自我修正能力,可以做内联编辑、代码填充等交互工作流

本地 AI 的曙光

18GB 显存, 700+ tokens/s , Apache 2.0 开源。

这三个条件凑在一起,意味着本地部署高性能文本 AI 不再是梦想。

对于开发者来说,这意味着:

  • 不需要 API key ,不需要网络,本地就能跑
  • 延迟极低,适合实时交互场景
  • 可以微调,可以部署到边缘设备

对于行业来说,这意味着:

  • 云端 API 不再是唯一选择
  • 隐私敏感场景有了新的解决方案
  • AI 本地化的门槛大幅降低

自回归的黄昏?

DiffusionGemma 不是要取代自回归,但它证明了扩散模型在文本生成领域同样有竞争力。

当 4 倍速、消费级 GPU 可跑、开源的扩散文本模型出现时,自回归的"唯一性"开始动摇。

这不是技术的终点,而是范式竞争的起点。

接下来要看的是:扩散模型在长文本生成、逻辑推理、多轮对话上的表现如何?能不能追上自回归的成熟度?

但至少现在,我们有了一个真正的选择。

封面高亮关键词: 4 倍速扩散, DiffusionGemma, 本地 AI