Google 发了个 DiffusionGemma,然后自己在 launch post 里写"生产环境请用 Gemma 4"。
大厂发布里这种坦诚不多见。
📌 模型本身:26B 总参、3.8B 激活的 MoE,主打 block-diffusion,H100 FP8 跑到 1100 tok·s,对 AR 大约 1.9 倍加速。
但架构仔细看是 hybrid——block 内 256 token 并行去噪,block 之间还是 AR 加 KV cache。
纯 diffusion LM 路线还没真正打通。
🔍 Reddit 上有个对照实测挺说明问题:让两个模型分别写 Jobs、Tetris、BeOS 三段,话题一个比一个冷门。
错误数依次是 4、12、12,越冷门塌得越厉害。
并行去噪和逐 token 概率建模,在长尾分布上的差距藏不住——hybrid 也补不回来。
⚠️ 所以 dLLM 现在大概就是这个位置:1.9 倍加速换 6 倍错误率。
Mercury、LLaDA 那波试水之后,第一次有一线大厂以主品牌背书、同时打上"实验性"标签——这个信号本身比模型更值得看。 google·diffusiongemma-26B-A4B-it
发布于 中国香港
