谷歌这个DiffusionGemma新模型,让我第一次觉得 AI 写字可能不一定要排队了
本周谷歌发了一个叫 DiffusionGemma 的模型。第一反应是,这名字有点怪——Gemma 是谷歌那条开源模型线,从小模型到本地模型一路做下来;Diffusion 是 AI 画图那套"从一团噪声里慢慢洗出一张图"的思路。两个词放在一起,就很有趣了,它不是拿 Gemma 去画图,而是拿扩散模型的思路去写字。
这事乍一看像是程序员会兴奋、普通人会划走的技术新闻。但我觉得它值得聊一聊——不是因为它今天就能把 ChatGPT、Claude、Deepseek 全部干翻,而是因为它给"AI 怎么写字"这件事,换了一种完全不同的方式。
我们现在熟悉的大模型,大概都像一台老式打字机:你问它一句话,它一个 token 一个 token 往外蹦,先写出上一句才轮到下一句,必须从左往右、一个坑一个坑填。你看到屏幕上一个字一个字往外蹦,不是产品经理特意做的打字动画,模型真的就是这么工作的。
我们今天看到的绝大多数强推理、强对话、强代码能力,都是在这套自回归架构上长出来的。它像一个很厉害的人坐在你旁边,一边想一边写,一边根据刚写下的东西继续往下推——讲一个复杂问题,它能讲得很好,但你得等;在本地电脑上跑,那种一点点吐字的迟滞感会很明显。
DiffusionGemma 不是这样。它不先写第一个字,再写第二个字,再写第三个字,而是先铺出一整块很模糊的文本区域——官方说法是一次并行生成 256 个 token。更像是暗房洗照片,桌上摊开一张还没显影的底片,里面已经隐约有构图,但细节全是噪声。
然后模型一轮一轮修。第一轮先把最有把握的位置定下来,第二轮根据已经清楚的部分继续修那些不确定的地方,第三轮把整段话的格式、逻辑、边界一起打磨。最后一整块文本浮出来——这和 AI 画图很像,画图模型不是一个像素一个像素画过去,而是整张图一起变清楚。DiffusionGemma 做的,就是把这种"全局显影"的逻辑搬到了文本上。
如果你经常用大模型写东西、改东西、补代码,大概遇到过这种感觉:你给模型一篇稿子,说"帮我把第三段改得更自然一点,但不要影响前后文"——结果它从你指定的位置开始顺着写,前面看得到,后面也能参考,但生成方向还是从左往右。它像一个人站在河中间,只能顺流而下,回头看可以,逆流重写很难。所以经常出现"局部还行,接回全文就不对劲"的结果。
这不是你的问题,是它的工作方式决定的。
DiffusionGemma 这种全局成型的方式,天然更适合中间填空——它不是只盯着当前位置往下续,而是同时看着前面和后面,让中间那块慢慢长成一个能接住两边的形状。这就像修墙,普通模型是从左边一路砌砖,砌到缺口再继续往右;DiffusionGemma 更像先看整面墙的结构,把缺口的大小、上下左右的缝隙都看清楚,再往里面塞一块最合适的砖。
这个差别看起来很小,但它可能影响一整类产品——代码里的 infill、文章里的局部润色、表格里的格式补全、结构化文案里的字数控制,甚至像数独、数学题、氨基酸序列这种前后强依赖的任务,都会因为这种"双向看、整体修"的方式而变得更适合。谷歌官方也说得很直白:一次并行生成 256 个 token 的时候,每个 token 都能看见其他 token。
想象一个普通模型在写 Markdown 表格,写到后面才发现前面列数对不上,于是开始补救——补得不好,整张表就歪了。而一个扩散文本模型从一开始就在看整块结构,哪一列该对齐,哪一个括号该闭合,哪一段代码该补完,它的工作方式更像先摆版,再填字。它不是更像一个会说话的人,而是更像一个会排版、会修稿、会整体看结构的机器。
不过有一点需要说清楚,DiffusionGemma 现在还是实验模型,谷歌自己也说标准 Gemma 4 仍然是高质量生产输出的推荐选择——为了速度和并行生成,DiffusionGemma 的整体输出质量低于 Gemma 4,如果你要的是最强推理、最稳答案、最可靠的生产级生成,它现在不是主力选手。
很多技术新闻容易写成爽文,新架构出现,旧时代结束,所有人准备被颠覆。但真实世界通常没这么干脆——新东西出来,第一件事往往不是取代旧东西,而是先找到一个旧东西不舒服的位置,钻进去。DiffusionGemma 钻进去的位置,是低延迟、本地、交互式、非线性文本生成。
谷歌给了几个数字,26B 的 MoE 模型,总参数 260 亿,推理时只激活 38 亿,量化后能压进消费级显卡的 18GB 显存,专用 GPU 上文本生成最高快 4 倍,H100 上超过每秒 1000 token,RTX 5090 上超过每秒 700 token。这些数字背后的含义是,它不是为云端大服务设计的,而是更适合一个人、一台机器、一个本地工作流——本地写代码时秒级补全,本地写文章时直接把整段替换方案显影出来,游戏里 NPC 的回应在本地显卡上快速冒出来,语音交互更接近实时接话。模型本身快了,不等于产品马上丝滑,中间还有推理框架、硬件、延迟抖动一整套链路要打通。但它把最硬的一块砖往前推了一步。
这里有个挺反直觉的点。我们过去总觉得大模型越强就越像人——会聊天、会写诗、会安慰你。但 DiffusionGemma 提醒我,AI 的未来可能不只是更像人,有些 AI 会越来越不像人。人写字必须一笔一笔写,AI 不一定;人修改文章通常顺着读、顺着改,AI 不一定;人做结构控制很费劲,要数格子、数行、数标点,但 AI 如果一开始就把整块文本当成一个高维结构,它可能比人更擅长这种事——就像飞机不是更快的鸟,真正能稳定飞起来的机器,反而越来越不像鸟。
普通模型生成文本是线性的,一句接一句,一字接一字。DiffusionGemma 生成文本是块状的,整段话像一块布一样被织出来,哪里松了补哪里,哪里断了接哪里。
这对内容创作者也有启发。我们平时写文章,其实也常被"打字机思维"绑住——非得从第一段写到最后一段,非得先开头再主体再结尾。但真正成熟的写作经常不是这样:先有一个中间的洞察,再回头找开头;先有一个结尾的余味,再往前铺垫;先有几个局部发亮的句子,再慢慢把整篇文章洗出来。先有噪声,再有轮廓,再有结构,最后才有句子——这不也挺扩散的吗?
也许未来最好的 AI 写作工具,不是一个在你光标后面接话的助手,而是一间暗房。
你把想法放进去。它不急着给你吐出第一句话,而是先帮你显影整块结构——哪里空,哪里乱,哪里前后接不上,哪里格式闭不住,都能在同一张底片上看见。最后你得到的不是一串字,而是一整块已经有形状的文本。
