DeepMind 开源 DiffusionGemma:26B MoE 文本扩散模型,H100 上 1000+ t/s
Google DeepMind 发布 DiffusionGemma,首个采用扩散式文本生成的开源大模型,Apache 2.0 许可,在单张 H100 上达到 1000+ tokens/s 推理速度。 DiffusionGemma 的核心创新是用扩散去噪取代逐 token 自回归。传统 LLM 必须从左到右逐个生成 token,而 DiffusionGemma 一次性在 256 token 的「画布」上生成随机噪声,再通过 Uniform State Diffusion 迭代去噪、并行精炼整个文本块。由于所有 token 可同时互相 attend,模型在生成过程中如果置信度下降,会主动注入噪声进行实时自我纠错(Error Correction via Re-Noising)。 模型架构为 Gemma 4 26B MoE,总参数 25.2B,每次推理仅激活 3.8B 参数。量化后可在 18GB VRAM 内运行。官方数据显示:H100 上超过 1000 tokens/s,RTX 5090 上约 700 tokens/s,NVIDIA DGX Spark 上约 150 tokens/s。支持 256K 上下文窗口、原生函数调用、35+ 语言,以及文本/图像/视频多模态输入。 NVIDIA 同步发布了 NVFP4 量化版本 nvidia/diffusiongemma-26B-A4B-it-NVFP4,在 H100 (FP8) 上达到 1100+ tokens/s。模型已集成 Hugging Face Transformers、vLLM 和 Unsloth,开发者可通过 NVIDIA NIM 和 NeMo AutoModel 完成从原型到生产的全流程部署。 Demis Hassabis 在 X 上表示,DiffusionGemma 的推理速度是同类 Gemma 4 模型的 4 倍。