洪亮劼
25-04-28 01:48

如果评估大语言模型的性能一直以来都是其最大的痛点。有没有比较好的经验和总结呢?在AAAI 2025上的短课程“Evaluating Large Language Models: Challenges and Methods”(http://t.cn/A6dXv50m)就尝试从多方面对这个方面的工作进行一些阶段性的总结。

这个短课程提到这么三个方面的趋势:1)评价正在从“客观”(也就是说往往没有人参与)往“有人参与”(Human-in-the-Loop)转变,2)评价正在从“静态”(主要是只数据和流程)到“动态”转变,以及3)评价从“统一”模式(也就是不管目标模型是什么都是一样的问题)到“挑战”模式(也就是根据模型的反映进行问题)的转变。

当然,如果说大语言模型是不是稳定,有一个方法就是看其是不是能够抵挡一些随机的扰动(Perturbations),比如在字符或者单词阶段引入一些随机的错误。这些错误人当然可以很容易发现。但是大语言模型至今对这些简单的随机扰动的抗干扰能力还是比较弱的。这说明这些模型都还在发展的早期。

另外,短课程花了一定篇幅讲解如何动态生成问题集。这里面一个非常重要的担心就是目前大语言模型的训练集越来越大,并且很多训练集已经包含了多种多样的数据。于是,如何能够在测试的时候产生新的测试案例就变的非常关键。

最后,一个日常用户可能比较难以接触到的方面就是大语言模型如何面对攻击,比如插入一些提示(Prompts)是可以打破目前大语言模型的正常反应的。这方面看得出来,很多大语言模型需要商业应用的话都有可能面临这样的攻击。

这个短课程建议对大语言模型评估有兴趣的读者大致浏览(耗时30分钟)。

发布于 美国