长期以来,语言研究主要依靠两种方法,即依赖直觉的内省方法和依赖真实数据的实证方法。这两种方法具有不同的哲学基础,前者是理性主义的,后者是经验主义的。
不可否认,理性主义的思辨方法在语言学研究中常常给人一种直击事物本质的感觉,可以让我们少走弯路,因而获得更高的效率;而经验主义依赖客观数据的方法耗时费力,而且不时还会爆出有些研究者操纵数据、歪曲事实的事情。我们认为,操纵数据、歪曲事实终究是极少数人的个体行为,语言研究需要科学化,决不能因为耗时费力而放弃,况且,语言学家的直觉也未必总是正确的,我们每个人自身的经验注定任何研究者对语言的认识总会或多或少地带有偏见,不顾语言事实的语言研究必然是缺乏科学性、没有解释力的。
Francis&Sinclair指出,语言学家的直觉一经提出,常常给人一种似乎合理的感觉,然而正是这种语言直觉使得我们无法观察到一些重要的语言事实。究其原因,我们认为,受限于过去的技术,我们很难处理大量的语言数据,况且当时也无法采集到大量的语言数据,只好退而求其次去依赖直觉。如今不同了,计算机技术已经变得十分发达和普及,处理文本数据十分容易。有了丰富的语言素材和发达的计算机技术,语言研究方法可以也应该发生一些变化了。
也正因为以上两方面的原因,语料库语言学近年来被越来越多的语言研究者所接受。对此,Sinclair给出这样的描述:“三十年前,我们刚刚开始做语料库研究之时,几乎人人都认为我们不可能处理数百万词的语料;二十年前,人们认为此事可能性极小,几乎是狂想;十年前,人们认为这事很有可能,但仍然是狂人之举;而到如今,这种做法已经变得十分普遍。”
Sinclair的以上描述是在二十多年前作出的,期间计算机技术获得了突飞猛进的发展,与此同时,语言数据的量级也呈几何倍数增加。在当今的大数据时代,语言研究没有理由置语言事实于不顾,依赖语料库已经成为语言研究者的共识。
语言研究中使用大型语料库有无可比拟的优势:
(1)出于对研究的科学性的考虑。科学研究的目的是从现实中总结规律,最终解决现实问题。语言理论与语言事实之间存在一种张力,不顾语言事实的理论是片面的。语言学与其他科学一样,应该注重语言事实,完善语言理论,而语料库中包含着我们靠直觉无法想象的事实,等待着我们去探索和挖掘。
(2)出于对数据分析效率的考虑。近几十年来,计算机硬件技术和自然语言处理软件技术取得了一系列突破性进展,当年百万词级的所谓大型语料库今天成了微型语料库,处理起来几乎不费吹灰之力,而相同的工作由人工几乎是不可能完成的。高效率的语言研究,特别是实证性研究,需要语料库分析技术。
(3)出于对研究结果可靠性的考虑。在已有的研究中,对相同的研究问题,因研究视角不同,研究方法差异等原因,常常会出现研究结果不一致甚至相互矛盾的现象。相反,几乎所有的语料库研究都是可以重复的。也就是说,基于相同的语料库,采用同样的方法,我们不可能得出不同的结论,因而基于语料库的研究便于重新验证已有研究。
在现时的语言研究中,广泛使用语料库已经成为一种普遍趋势。语言研究者需要更多考虑的是已经不再是是否应该使用语料库,而是如何利用语料库。语料库已经成为语言研究中的默认资源。
总之,出于科学性、可靠性和工作效率等方面的考虑,对于任何可以通过语料库解决的问题,我们没有理由不使用语料库。
——梁茂成《什么是语料库语言学》
发布于 江苏
