
AI公司疯狂收购旧书销毁,只为纯净数据?
多家AI公司被曝通过中间商大规模收购2022年前出版的纸质旧书,采用切脊扫描后销毁原件的方式获取“纯净”训练数据,此举因涉及版权争议与文化保护问题引发全球热议,美国联邦法院已裁定相关操作合法,但Anthropic因另涉盗版数据被判赔15亿美元。


一、事件背景:AI公司为何“抢书”
调查媒体404 Media报道,以Anthropic为代表的多家AI公司正通过中间商大规模收购二手纸质图书,用于大模型训练。背后的核心原因是:随着生成式AI普及,互联网被大量AI生成的“垃圾内容”污染,继续使用网络数据训练可能导致模型退化。而2022年前出版的纸质书几乎不含AI生成内容,被视为“纯净的人类原创语料”。
二、具体操作:破坏性扫描与销毁
为提高效率,相关企业采用破坏性扫描方式:- 用机器切除书脊,将书页送入高速工业扫描仪- 完成数字化后直接粉碎或销毁纸质原件- 中间商ISBNdb面向AI公司提供批量采购服务,订单规模从1000本到100万本不等,且为买家保密
二手书商反映,自2026年4月以来销量暴涨五倍,买家对价格不敏感,不限题材和类型。
三、法律界定:合法与违法的边界
1. 破坏性扫描被视为“合理使用”2025年6月,美国北加州联邦法院在Bartz v. Anthropic案中裁定:合法购入纸质书后一对一数字化转换并销毁原件用于AI训练,属于版权法中的合理使用。核心逻辑是销毁原件后同一时间只存在一份数字副本。
2. 盗版数据触犯法律Anthropic因从盗版网站下载并长期保存超700万本电子书,被法院认定构成侵权。2026年7月,法院批准15亿美元(约101亿元人民币)的和解协议,这是美国史上最高昂的AI版权赔偿案。
四、核心争议:文化传承与数据垄断
1. 绝版珍本可能永久消失系统性大规模采购中,普通图书与绝版书、孤本并未区分。书商和学者担忧,存世极少的珍稀书籍可能被送入销毁流水线,原件毁后无法复原。
2. 知识从公共资产变为私有黑箱扫描后的数字文件进入企业私有数据库仅用于AI训练,公众无法访问。批评者指出,这相当于用全人类的文化遗产喂养少数公司的商业模型,切断了知识的公共溯源机制。
3. 行业内的不同立场马斯克公开表态,已要求旗下SpaceX AI团队对珍稀书籍采用非破坏性方式扫描并保留原件。他批评直接切断书脊的做法,并强调保存实体书的重要性。
五、行业趋势与技术挑战
2026年,一个出版商联盟已对谷歌提起诉讼,指控其未经授权使用数百万本受版权保护的图书训练Gemini AI模型。
多位作家与作者协会已发起集体诉讼,要求AI公司为使用原创作品训练模型支付合理报酬。
数据质量正取代数据数量成为AI竞争的关键指标,高质量人类原创内容的价值被重新定价。
六、建设性方向与行业反思
数字化保存不等于物理毁灭:技术进步应兼顾文明载体保护,可保留实体书原件的非破坏性方案更有可持续性。
法律只能划定底线,难以修复已造成的文化伤痕。美国国会正推进CLEAR法案与TRAIN法案,要求AI训练数据透明化;中国相关法规也已要求生成式AI使用合法来源数据。
创作者权益保护与技术创新需并行:多家媒体和出版机构呼吁AI企业探索授权合作与合理付费模式,而非绕开法律与伦理获取训练数据。