唐杰THU
24-06-07 12:23 微博认证:清华大学教授,AMiner创始人 唐杰

http://t.cn/A6HnsqIP
Transformers和State-Space Models,SSMs之间的关系。变换器在语言建模方面取得了巨大成功,但最近的研究表明,SSMs,如Mamba模型,在小到中等规模的任务上可以与变换器相媲美甚至超越。

文章的作者提出,这两种模型家族实际上非常相似,并通过状态空间对偶性(State Space Duality,SSD)框架展示了SSMs与变换器中使用的注意力机制之间的理论联系。SSD框架使用结构化半分离矩阵的各种分解来建立这些联系。

基于SSD框架,作者设计了一个新的架构,称为Mamba-2。Mamba-2的核心层是Mamba选择性SSM的改进版本,速度提高了2-8倍。尽管速度有所提升,Mamba-2在语言建模任务上仍然与变换器保持竞争力。

这个研究突出了SSMs和变换器之间的相似性,提出了一个新框架来理解它们的联系,并引入了一个结合了两种方法优势的新模型(Mamba-2)。这项研究为改进深度学习模型在语言建模和其他领域的效率和效果开辟了新的可能性。

发布于 北京