Simon的白日梦
26-05-17 15:12 微博认证:科技博主

还是挺期待大语言模型除了 Transformer 外能出一点底层上的新架构的。🥹

ELF,把扩散模型搬进语言生成,但不再每一步都咬住 token

何恺明团队这篇新论文 ELF: Embedded Language Flows 做的是一种连续扩散语言模型。

传统 GPT 路线是自回归:一个 token 一个 token 往后预测。ELF 走另一条路:先把文本 token 映射成连续 embedding,然后在连续空间里做 Flow Matching / denoising,直到最后一步才把连续表示重新投回离散 token。

关键点不是“语言也能扩散”,而是:中间过程不再反复跟词表硬对齐。ELF 把这件事拆开:中间纯连续,最后才离散化,而且不需要额外 decoder,用同一个网络共享权重完成去噪和最终解码。

ELF-B 只有 105M 参数,在 OpenWebText 上训练约 45B tokens,用 32 步采样,生成困惑度做到 24.1;对比很多扩散语言模型需要 1024 步、500B+ tokens,卖点就是更少训练 token、更少采样步数、更低生成困惑度。

这不是一个能直接挑战 GPT-4/Claude 的通用 LLM,而是一个研究信号:连续扩散语言模型这条路线可能没死,只是以前没把“连续”做到底。

中文阅读:http://t.cn/AXiiTFXt(文章)
论文:http://t.cn/AXiiTFXG(论文)
代码:http://t.cn/AXiiTFXq(GitHub)
模型:http://t.cn/AXiiTFXc(HF)
#HOW I AI# #ai生活指南# #AI工具#

发布于 广西