推荐google的Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention,http://t.cn/A6TkyNUd
这篇文章介绍了一种名为Infini-attention的新注意力机制,它集成了压缩记忆模块,使Transformer模型能够高效地处理无限长的输入序列。主要内容包括:
1. Infini-attention在标准点积注意力机制中引入了压缩记忆模块,能够有效地存储和检索过去的键值对信息。
2. 通过将压缩记忆与局部注意力机制相结合,Infini-attention可以自然地扩展现有的语言模型,使其能够处理无限长的上下文。
3. 在长上下文语言建模基准测试中,Infini-Transformer模型的性能优于基准模型,同时具有较小的内存占用。
4. 经过微调和持续预训练后,1B参数量的Infini-Transformer模型可以解决长达1M的passkey检索任务。
5. 经过持续预训练和微调,8B参数量的Infini-Transformer模型在500K长度的书籍摘要任务上取得了新的state-of-the-art结果。
6. Infini-attention引入的参数量非常小,使得Transformer模型可以以流式方式高效地处理超长输入序列。
by ChatGLM.cn
发布于 英国
