洪亮劼
25-03-10 00:44

Marc A. Najork(http://t.cn/A6B2pLz5)是Google DeepMind的Distinguished Research Scientist。他在信息检索(Information Retrieval)领域有长期的突出贡献,曾经担任重要期刊ACM Transactions on the Web的主编。其也是四院院士AAAS院士, ACM院士, IEEE院士和AAIA院士。

Marc在SIGIR 2023上题为“Generative Information Retrieval”(http://t.cn/A6B2pLzq)的主旨演讲(Keynote Speech)对于如何应用“生成式AI"(Generative AI)到信息检索领域有深入的探讨。

第一,Marc简单回顾了过去40年信息检索系统的发展历程,特别是“倒排索引”(Inverted Index)系统在信息检索系统中的核心地位和围绕着其产生的诸多优化。

第二,Marc介绍了Large Language Model在“问答系统”(Question Answering)中起到的新的作用,也就是直接生成答案。当然,这在2021年左右的时候,还是蛮有争议的一个话题,今天来看,LLM在这方面的能力问题已经不容置疑了。

第三,Marc介绍了一些新的思路,比如完全的“生成式信息检索”(Generative IR),直接学习从Query到Doc ID的映射。这自然是有一定的挑战的。然后还有一些没有那么激进的思路,比如Retrieval Augmented Generation,或者叫RAG。

总之,这篇资料值得希望快速了解信息检索系统前世今生以及最新的一些应用动态的朋友们快速浏览,考虑到内容是2023年的,肯定有一些内容已经有了更新,但Marc的高屋建瓴的总结依然是很有价值的。

发布于 美国