代码浪潮记
16小时前来自 科技看点

AI公司批量抢购旧书,背后竟是为了给大模型“洗数据”?

多家海外AI公司正通过中间商批量收购二手旧书,扫描后直接销毁,只为获取2022年前出版、未被AI“垃圾内容”污染的纯净人类文本作为训练数据,这一做法在提供高质量训练语料的同时,也引发了关于知识垄断和文化遗产保护的激烈争议 。

一、核心动因:AI训练数据的“纯净性危机”

互联网数据污染:2022年ChatGPT爆火后,大量AI生成的低质量内容(业内称“AI slop”)充斥网络,模型反复学习这类数据会导致逻辑退化、创造力下降,陷入“自己抄自己”的死循环 。

纸质书的“稀缺价值”:2022年前出版的实体书被AI公司视为“纯净语料”,这部分内容由人类写作+专业校对,几乎不含AI生成痕迹,在全球优质数字文本见顶的背景下,成为大模型训练不可替代的资源 。

采购规模惊人:相关订单从单次1000本到一次采购100万本不等,二手书商销量较平时涨了5倍。买家不计价格、不限题材,只认ISBN编码和2022年以前的出版年份 。

二、操作方式与法律边界

“切脊—扫描—销毁”流程:为高效且低成本地获取数据,AI公司将书籍切除书脊后送入高速工业扫描仪,完成数字化后直接粉碎销毁实体书。这种方式比非破坏性扫描成本更低、效率更高 。

判例支持“合理使用”:2025年6月,美国北加州联邦法院裁定,合法购入纸质书后进行一对一数字化转换、并销毁原件用于AI训练,属于版权法中的“合理使用”。该裁定仅不适用于盗版书籍的采购行为 。

双重风险:Anthropic虽然在这一操作上未被处罚,但该公司此前因长期持有700万本盗版图书数据库,最终被判赔偿15亿美元(约合101亿元人民币)。

三、矛盾焦点:技术进步与公共知识传承

绝版珍本不可逆损毁:由于采购对象随机且不区分珍贵程度,大量稀有的绝版书、18-19世纪学术文献甚至仅存几本的孤本被一并送入碎纸机,这些纸质原件一旦消失便无法恢复 。

知识的“私有化圈地”:扫描后的数字文本被锁进AI企业的私有数据库,仅供模型训练使用,公众无法访问。这相当于用实体文献的物理消亡,为科技巨头的封闭知识库“输血”,而被剥夺了公共流通的权利 。

行业内部的分歧:埃隆·马斯克已公开要求其SpaceX AI团队,对珍稀书籍采用非破坏性方式扫描并保留原件,与Anthropic的销毁做法形成鲜明对比 。