在最近10年的人工智能和机器学习快速迭代的浪潮中,有一个说法深得众多硬件以及软件生产商的认同,那就是所谓的,“大力出奇迹”。这里面的“大力”有两层含义,第一层是算力的提升,随着GPU技术的创新,我们可以寄希望于硬件可以在相同的数据量上提升计算的单位时间。第二层是对数据量处理的提升,特别是对巨量训练数据的处理能力的提升。
然而,是不是所有的训练数据都是有帮助的数据呢?有没有办法只用少量的数据就能够达到巨量数据的效果呢?还有就是,如果数据中有一些噪声,如何来构建更加“健壮”(或者叫“鲁棒性”)的训练数据基呢?这些关于“数据效率”(Data Efficiency)的问题在“大力出奇迹”的年代依然非常重要。原因是,能够节省的算力往往意味的金钱(比如购买GPU,或者租用云服务的资金)的节省和对二氧化碳排放的节省,这在未来的计算视野中,都是不可或缺的影响因素。
来自UCLA的研究人员Baharan Mirzasoleiman(http://t.cn/A6nqaqTq)和Siddharth Joshi(http://t.cn/A6nqaqTV)在今年的ICML 2024大会上做了一个叫“Foundations of Data-efficient Machine Learning”(http://t.cn/A6nqaqT5)的短课程报告。在这个讲座中,Baharan和Siddharth详细介绍了目前的Data Efficient Superviserd Learning的基础和发展。这部分内容可以说是整个短课程的核心。然后,内容再扩展到Self-supervised Contrastive Pretraining,以及最后达到Contrastive Language-Image Pretraining和Training of Large Language Models。可以说内容非常丰富。 在特定数据集合任务的情况下,采用了Data Efficient的训练算法可以达到惊人的效率提升(比如扔到一半的训练数据)。同时,Data Efficient也可以帮助训练算法达到某种的”健壮性“,可以算是一举两得。整个讲座大概需要1到1个半小时看完。建议对这方面感性的读者看看。
