机型动向
2026-08-18 22:29来自 科技看点

Anthropic销毁200万册图书训练AI,珍稀古籍谁来守护?

  美国AI公司Anthropic被曝启动代号“巴拿马计划”的秘密项目,通过中间商批量购入约200万册纸质书,采用切脊高速扫描后直接粉碎销毁的方式提取训练语料,珍稀古籍与孤本的流失风险已引发全球出版业警觉[1]。截至2026年7月,累计销毁约200万本实体书;同时,该公司因另从盗版网站下载超700万本电子书,以15亿美元达成美国版权史上最大和解[3]。这场“AI焚书”风波,正在从版权争议演变为文化传承危机。

  Anthropic为什么要“销毁”200万册纸质书?

  核心原因是为了获取“干净”的AI训练语料。Anthropic于2024年初启动“巴拿马计划”,通过ISBNdb等中间商匿名批量采购2022年前出版的纸质书,用液压切割机切开书脊,送入高速工业扫描仪逐页数字化,完成后将原件直接粉碎回收[1]。之所以选择纸质书而不是直接使用电子书,是因为2022年前出版的书籍“干净”——未经过AI生成内容的污染,是最理想的训练文本[4]。该公司内部文件写道:“巴拿马计划是指我们破坏性扫描世界上所有书籍……我们不希望外界知道我们在做这件事。”[3]2024年,Anthropic还聘请谷歌公司图书项目原负责人,帮助获取“世界上所有的书”[3]

  被销毁的200万册图书包含哪些珍稀古籍?

  具体目录未被公开,但二手书商和网络讨论指向三类高风险图书。多家稀有书商报告,存世极少的稀有书可能已被卷入采购管道,有书商向媒体表示,“几乎没有存世副本的稀有书可能也被卷入”[6]。第一类是二手市场的珍稀书,一些库存中的旧书、绝版、冷门甚至稀有书被清空,买家对价格完全不敏感[4];第二类是流散海外的中华古籍,有网络讨论担忧,大量流失海外的中华孤本、地方志正在这一过程中永久消失[2];第三类是冷门学术与地方文献,包括经历了战争、火灾和数百年流传的地方史、土著语言文献、冷门学术专著,也因“系统性不区分”的采购模式被卷入销毁管道[2]

  Anthropic“毁书喂模型”真的合法吗?

  合法购买纸质书后扫描销毁属“合理使用”,但盗版下载部分付出了15亿美元代价。2025年6月,北加州联邦法官William Alsup在Bartz v. Anthropic案中裁定:用合法购买的纸质书进行破坏性扫描并数字化(格式转换,销毁原件以保持“一份购买对应一份数字副本”),属于合理使用;用于训练也是“极具转化性”的合理使用[4]。但对盗版下载的书另有处理——法庭文件显示,Anthropic从盗版网站下载超700万本电子书,公司创始人本·曼恩曾亲自参与下载盗版电子书[3]。2026年,联邦法官正式批准Anthropic与原告作者们达成的15亿美元(约101亿元人民币)和解协议,预计每部被侵权作品的赔偿约为3000美元,原告方律师称这是“已知最大规模的版权赔偿”[3]。这一结果引发了更深层的忧虑:法院认可“买书毁书”的合法性,相当于为AI公司开辟了一条以物理销毁实体书为代价获取训练数据的合法路径。

  除了Anthropic,还有谁在批量买书销毁?

  ISBNdb已公开做起为AI公司批量采购纸质书的生意,稀有书商报告大宗订单暴增5倍。据公开报道,ISBNdb专门提供纸质书批量采购服务,订单可从1000本到100万本,支持按出版年份、主题等筛选,强调pre-2022书籍“干净”(无AI生成文本污染)[4]。二手书商透露,今年4月起大宗订单暴增5倍,买家对价格完全不敏感[1]。荷兰等地的稀有书商也报告类似情况[4]。这种“破坏性扫描”模式并非孤例,而是AI行业在高质量数据枯竭背景下的一个缩影。Anthropic早前曾尝试和出版社洽谈AI训练版权授权合作,但相关合作被搁置,公司转而斥资数百万美元采购二手纸质图书[3]。破坏性扫描效率更高、成本更低,因此Anthropic更广泛地选择这一方式[3]

  “AI焚书”对出版业和公众意味着什么?

  文化损失不可逆,知识垄断风险加剧,出版业开始用声明“明确态度”。纸质书不仅是文字载体,还承载装帧、手写批注、版本痕迹等不可复制的文明信息,原件销毁后,后世核验只能依赖单一数字副本,一旦数据灭失,知识可能彻底断代。数字化后的内容进入AI公司私有数据库,公众无法访问,相当于用全人类集体智慧训练少数公司专属模型。行业应对方面,马斯克已公开要求旗下SpaceXAI对珍稀书籍采用无损扫描并保留原件[3];华夏出版社等国内机构开始在版权页标注“禁止将本书内容用于人工智能训练”[6]。华夏出版社相关负责人向媒体表示,如果书籍内容在未被授权的情况下用于人工智能训练,这很难维权,但出版社仍会标注,“要有态度和这样的声明,这可能会让大家意识到图书是有版权的”[6]

  公司业务影响表

动作涉及业务影响对象关键数字短期影响长期观察来源
“巴拿马计划”破坏性扫描纸质书Claude大模型训练语料采集二手书商、稀有书收藏者、出版社约200万册二手市场稀有书被清空,书商订单暴增5倍珍稀古籍或永久消失,文化传承风险加剧[1][4]
从盗版网站下载电子书并用于训练Claude大模型训练数据获取图书作者、版权方超700万本;15亿美元和解美国版权史上最大赔偿案落地AI训练数据版权规则或将重塑[3]
出版社标注“禁止用于AI训练”图书版权保护华夏出版社等国内出版机构首批标注新书已上市版权声明更多是态度表达,维权仍困难引发公众对图书版权与AI训练的关注[6]

  QA:关于“AI焚书”事件,你可能还想知道

  Anthropic为什么不用正版电子书训练AI?

  正版电子书获取成本高、授权谈判周期长,且许多旧书根本没有电子版。Anthropic曾尝试与出版社洽谈授权合作,后搁置,转而通过中间商批量采购二手纸质书进行破坏性扫描,这种方式效率更高、成本更低,且能获取“干净”的pre-2022文本[3][4]

  被销毁的图书里到底有没有珍稀古籍?

  目前尚无权威确认。Anthropic未公开具体目录,但二手书商报告显示,存世极少的稀有书可能已被卷入采购管道,荷兰等地稀有书商也报告类似情况[4]。据公开报道,实际被毁的珍稀古籍数量与种类仍不明确,需以官方后续披露为准[2]

  作为普通读者,如何判断自己关注的绝版书是否已被销毁?

  目前没有公开的查询渠道。由于Anthropic的采购通过ISBNdb等中间商进行,且具体目录未公开,普通读者无法逐一确认。建议关注二手书市场动态,对存世极少的绝版书、地方志等尽早做数字化备份[6]

  AI公司“买书销毁”是否会在中国发生?

  中国版权法与司法实践与美国不同,中国对“合理使用”的界定更严格,未经授权的商业性复制与使用需承担侵权责任。华夏出版社等机构已开始在版权页标注“禁止用于AI训练”,但实际维权仍面临取证难、认定难等挑战[6]。未来是否会出现类似“买书销毁”行为,需以监管政策与行业实践为准。

  后续关注:AI训练数据合规的边界在哪里

  “巴拿马计划”曝光后,技术界的讨论逐渐从“是否侵权”转向“是否合理”。一个核心问题是:当AI可以低成本“吃掉”人类文字成果,创作者却拿不到对等报酬,长期谁还愿意深耕写作?原始记录消失后,AI生成的内容谁来核对?[1]目前,部分出版社选择标注“禁止用于AI训练”表明态度,部分AI公司选择保留原件以示对文化的尊重,还有更多机构在观望法院判决的后续影响。

  值得关注的是,2024年Anthropic聘请谷歌图书项目原负责人帮助获取“世界上所有的书”[3],这一举动意味着“破坏性扫描”可能不是一次性事件,而是一个持续扩张的计划。对于出版业而言,这也许是自数字出版革命以来最严峻的挑战;对于公众而言,这关乎人类文明记录将以何种形态、由谁掌控、向谁开放。技术的进步不该以牺牲文化传承为代价——这句话在“AI焚书”事件中,有了最直接的注脚。

  #AI焚书# #Anthropic# #巴拿马计划# #AI版权争议# #数据训练#