星际万象笺
15小时前来自 科技看点

AI公司疯狂收购旧书,背后竟是为防“模型崩塌”?

AI公司(如Anthropic)近期被曝通过中间商大规模扫购2022年前出版的旧书,用破坏性方式切脊扫描后直接销毁实体书,核心原因在于互联网已被AI生成的“垃圾语料”污染,而旧书是仅剩的、未受污染的高质量人类原创数据,能避免大模型越学越“傻”的“模型崩塌”风险。

一、互联网数据被AI污染,传统语料失效

AI生成内容泛滥:2022年ChatGPT爆火后,互联网上新增的文字内容大量由AI生成,这些内容同质化、低质量,被业内称为“AI slop”。

模型自噬风险:用AI生成的数据继续训练大模型,会导致模型逻辑混乱、创造力退化,陷入“自己抄自己”的死循环,即“模型崩塌”。因此,AI公司急需寻找未被AI污染过的“纯净”语料。

二、旧书成为稀缺的“干净数据金矿”

2022年之前出版的纸质书:这些书籍完全由人类创作、经过专业编辑校对,几乎没有AI生成内容的掺杂,逻辑严谨、信息密度高,是当前最优质的训练素材。

数据质量取代数量:当互联网公开数据被AI污染后,数据质量成为下一阶段AI竞争的分水岭,旧书中的原创知识资产护城河加深。

三、法律与商业双重驱动的“焚书”操作

法律上的“合理使用”认定:美国法院在相关案例中裁定,企业合法购买正版实体书后,通过破坏性扫描生成单一数字副本并销毁原件,属于版权法中的“合理使用”,不构成侵权。

规避版权谈判成本:直接购买旧书并销毁,绕开了与出版社和作者逐一谈判授权的高昂成本与复杂流程,成为部分AI公司规避版权诉讼的“捷径”。

建立数据壁垒:扫描后的数据进入企业私有数据库,其他竞争对手无法获取,形成独家训练数据护城河,强化模型优势。