每次前向生成 256 个 token ,速度是自回归的 4 倍。
这不是论文里的假设,是 Google DeepMind 刚刚开源的 DiffusionGemma——一个真正能跑的扩散文本模型。
数字说话
先看硬指标:
- 26B 参数的 MoE 架构,推理时只激活 3.8B
- 量化后 18GB 显存就能跑,消费级 GPU 友好
- H100 上 1000+ tokens/s , RTX 5090 上 700+ tokens/s
- 速度比同级别自回归模型快 4 倍
这意味着什么?意味着你可以在一台游戏 PC 上,以每秒 700 个 token 的速度生成文本。
扩散模型的文本革命
扩散模型在图像生成领域已经证明了威力——Stable Diffusion、Midjourney 都是基于这个范式。
但在文本生成领域,自回归一直是绝对主流。GPT、Claude、Gemini、Llama ,本质上都是"一个 token 一个 token 往外蹦"。
DiffusionGemma 打破了这个范式。它不是一次生成一个 token ,而是每次前向并行生成 256 个 token。
这带来了两个关键优势:
- 速度:并行生成, 4 倍提速
- 双向注意力:具备自我修正能力,可以做内联编辑、代码填充等交互工作流
本地 AI 的曙光
18GB 显存, 700+ tokens/s , Apache 2.0 开源。
这三个条件凑在一起,意味着本地部署高性能文本 AI 不再是梦想。
对于开发者来说,这意味着:
- 不需要 API key ,不需要网络,本地就能跑
- 延迟极低,适合实时交互场景
- 可以微调,可以部署到边缘设备
对于行业来说,这意味着:
- 云端 API 不再是唯一选择
- 隐私敏感场景有了新的解决方案
- AI 本地化的门槛大幅降低
自回归的黄昏?
DiffusionGemma 不是要取代自回归,但它证明了扩散模型在文本生成领域同样有竞争力。
当 4 倍速、消费级 GPU 可跑、开源的扩散文本模型出现时,自回归的"唯一性"开始动摇。
这不是技术的终点,而是范式竞争的起点。
接下来要看的是:扩散模型在长文本生成、逻辑推理、多轮对话上的表现如何?能不能追上自回归的成熟度?
但至少现在,我们有了一个真正的选择。
封面高亮关键词: 4 倍速扩散, DiffusionGemma, 本地 AI


