次元造物集
7-30 19:20来自 科技看点

AI公司大量采购纸质书籍反映出了什么行业趋势?

Anthropic“巴拿马计划”大规模采购纸质书、切脊扫描后销毁以获取训练数据的做法,遭到马斯克公开批评并呼吁无损扫描,这一事件折射出AI行业训练数据正从网络扩张转向物理世界“抢收”人类原创内容,以及高质量语料成为核心竞争壁垒的深层趋势。

一、数据污染倒逼AI公司“回采”纸质书

大模型训练依赖海量文本,但互联网上的公开数据正被AI生成内容严重污染。

2022年后,ChatGPT等生成式AI爆发,导致网络充斥大量机器生产的低质文本。

模型若持续用AI生成数据训练,会出现“模型崩塌”,性能退化。

2022年前出版的纸质书被视为“纯净”的人类原创语料,不含AI生成污染。

Anropic为此启动“巴拿马计划”,批量采购二手书、绝版书甚至珍稀古籍。

这一现象表明,当网络数据质量下降时,AI公司不得不回归物理世界的传统出版物,以获取可靠训练素材。

二、数据质量取代模型规模成为新竞争焦点

AI竞赛正从参数量的比拼转向数据价值的深度挖掘。

互联网公开数据几近耗尽,高质量人类语料成为稀缺资源。

ISBNdb等中间商专门为AI公司提供批量购书服务,订单可达100万册。

买方对价格不敏感,且偏好2022年以前的书籍以保证“干净”。

数据清洗和价值判断能力成为AI公司核心竞争力。

这标志着行业进入“数据质量驱动”阶段,谁拥有更优质、更独特的数据,谁就能在模型能力上建立优势。

三、合规路径探索:从盗版到“买断销毁”的灰色创新

Anropic同时面临盗版诉讼与实体书采购的法律边界问题。

法院裁定合法购买纸质书后进行破坏性扫描并销毁原件,属于合理使用。

但Anropic因从盗版网站(如LibGen)下载超过700万本书,被判赔偿15亿美元。

法律逻辑:买断后只保留一份数字副本,不增加市场供给,故不侵权。

这种“买-扫-毁”模式成为规避版权风险的极端方案。

此举暴露出版权体系在AI时代的滞后性,也促使行业探索更可持续的数据授权与合作模式。

四、文化保护与技术进步的矛盾浮出水面

破坏性扫描对稀有书籍造成不可逆损失,引发文化界强烈批评。

大量绝版书、地方志、冷门学术著作被切脊粉碎。

一些存世仅数本的18世纪植物学文本可能已被销毁。

马斯克公开要求SpaceX AI团队采用无损扫描,将原书保存入图书馆。

舆论呼吁法律禁止销毁绝版书,并强制移交公共机构存档。

这揭示了AI数据获取与文化遗产保存之间的根本冲突,行业需建立更文明的语料采集标准。

五、产业链重构:二手书市场、中间商与出版社角色转变

AI公司的巨量采购正重塑传统图书流通链。

二手书商订单暴增,原本每周卖20本的书商现在能卖出数百本。

ISBNdb等数据服务商转型为AI语料供应商,提供匿名采购和保密协议。

出版社与AI公司之间版权诉讼频发,谷歌、微软等也面临类似诉讼。

中信证券预计,文化IP数字化运营将为出版业带来约700亿元增量空间。

传统出版业从内容创作者变为AI数据原料提供商,产业链价值分配亟待重新定义。

六、行业规范与伦理标准的建设压力

Anropic的极端做法加速了全球对AI数据伦理的讨论。

欧盟、美国等司法辖区加速制定AI训练数据透明度规则。

业界呼吁强制公开语料清洗规则,保护方言、少数民族语言等非主流文化。

中文世界高质量语料严重不足,需加快建设自主语料库。

无损扫描与实体保留成为行业自律标杆,SpaceX AI的做法或成示范。

可以预见,未来AI公司将在数据来源合规性、文化尊重度和可追溯性上投入更多资源。