社会百态留影
2026-08-17 16:33来自 科技看点

AI公司购买书籍销毁事件全解析:Anthropic「巴拿马计划」

  2026年7月,独立媒体404 Media结合解封法庭文件曝光:美国AI公司Anthropic(Claude开发方)自2024年启动内部代号巴拿马计划(Project Panama),通过中间商匿名批量收购二手纸质图书,高速扫描数字化后将实体原件全部销毁。该事件涉及数百万册图书,围绕版权合理使用、文化留存与AI训练数据伦理引发巨大争议。

  一、事件核心事实

  • 操作流程:通过中间商匿名大批量收购二手纸质图书;使用液压设备切除书脊拆成散页,高速工业扫描数字化;扫描完成后全部粉碎、纸浆回收,不再保留实体原件,涉及数百万册图书。
  • 采购筛选标准:优先收购2022年之前出版书籍。行业普遍认为,2022年后互联网大量充斥AI生成文本,会造成训练数据「污染」;早年纸质书以纯人类原创内容为主,属于高质量干净训练语料。
  • 产业链现状:多家AI企业通过ISBNdb等中介采购,单笔订单规模从1000本至100万本不等,采购签订严格保密协议;欧美多国旧书商收到大批量匿名购书订单,部分订单包含绝版、小众稀缺图书。

  二、两大关键动机

  1. 技术需求:规避「模型崩溃」

  互联网海量内容已经混入AI生成文字,若持续使用网络公开数据训练,会出现模型崩溃(AI反复学习自身产出的失真内容,持续退化)。无AI污染的纸质出版物成为稀缺训练素材。无损扫描设备速度慢、成本极高,企业倾向破坏性高速扫描提升效率。

  2. 核心法律考量(争议焦点)

  美国联邦法院法官William Alsup作出关键裁定:

合法购买实体图书→破坏性扫描→销毁原书,属于美国版权法下合理使用(Fair Use)

  法官核心理由:企业仅用数字副本替换自己持有的实体副本,没有新增额外流通拷贝;销毁原书被视作该判定成立的重要条件。

  简单理解行业内部逻辑:

  • 保留实体书+数字扫描件:容易被认定「制作额外复制件」,侵权风险上升;
  • 实体原件销毁,仅内部留存数字训练数据,被法院认定不构成版权侵权,无需向作者、出版商支付额外授权费用

  对比区分:Anthropic早期直接从盗版文库LibGen、Books3下载700万本电子书训练模型,被法院认定侵权;最终达成15亿美元和解协议,并且要求删除全部盗版电子数据集。

  三、舆论与行业争议

  支持/企业视角

  • 书籍通过合法市场交易购入,企业拥有物品所有权,有权处置;
  • 大模型训练具备转化性使用价值,符合数字时代版权「合理使用」的拓展解释;
  • 书籍最终送往回收造纸,不存在单纯焚毁浪费。

  反对声音(作家、藏书界、文化研究者)

  • 永久性文化损失风险:部分绝版、小众著作仅存少量流通实体本,一旦被收购销毁,世界上将彻底失去纸质原件;数字化文本无法复刻实体书籍版本信息、装帧、批注等附加信息;
  • 知识垄断隐患:原始实体消失,唯一数字副本封闭在AI企业私有数据库,公众失去独立核验原始文本的渠道;
  • 创作者权益失衡:作者无法从AI企业利用其著作训练模型获得持续收益;商业巨头无偿攫取数十年人类文字成果牟利。

  四、行业不同立场回应

  • 马斯克(SpaceX AI):公开表态反对破坏性扫描,要求团队全部采用无损扫描,保留原始书籍;
  • 出版机构、作家协会:强烈呼吁立法修订AI训练数据版权规则,限制批量收购销毁稀缺图书的商业行为;
  • 古籍、珍本交易圈:已经开始警惕大额匿名批量订单,主动区分普通流通旧书与孤本、绝版文献,拒绝向不明AI买家出售珍稀典籍。

  五、重要澄清网传谣言

  • 不实:「销毁数百万册古籍孤本」。真实信息:无法证实被销毁图书中包含大量珍稀孤本,存在自媒体夸大渲染;但存在绝版小众图书被销毁的潜在风险。
  • 不实:全球所有AI公司都在大规模焚书。事实:目前有明确法庭文件实锤大规模行动的主体为Anthropic,其余企业更多是小规模试探采购,完整规模缺乏公开证据。
  • 不实:该模式在中国可以照搬。事实:中美版权法律体系完全不同。我国《著作权法》不存在等同美国的「合理使用」规则,未经许可扫描受版权保护图书用于AI商业训练,存在明确侵权风险;同时国内古籍、珍稀文献交易受到文物、出版法规严格监管。

  六、延伸思考:AI产业内在悖论

  AI大规模普及产生大量机器生成内容,污染公开网络语料;企业为继续迭代模型,回头争夺留存人类原创文字的纸质图书,甚至不惜销毁实物。

  越成功的生成式AI,会持续消耗自身赖以成长的人类原创数据源头。