出版社标注禁用于ai训练后,如何发现侵权行为?
回答首句
当出版社会在新书版权页上印上“禁止将本书用于人工智能训练”时,这更像是一种态度宣示而非技术屏障——因为AI的训练数据被切碎、转化为参数后,输出内容与原文可能“完全不一样”,导致传统的侵权发现方法几乎失效,维权则更难。
回答正文
一、侵权发现的主要障碍:技术鸿沟
训练与输出的非等同性:AI在训练时将文本切碎转化为海量数据与参数,投喂的内容和最终输出的内容可能完全不同,版权持有人难以证明AI的某个输出“来自”其特定书籍。
取证困境的公开承认:华夏出版社相关负责人坦言:“人工智能的技术一直在更迭,投喂给它的东西和它‘吐’出来的东西,可能完全不一样,在这种情况下是很难维权的。”
法律归责缺位:目前国内相关法律尚未明确规定AI训练使用受版权保护文本的具体边界,合理使用的抗辩空间尚未被完全排除,导致权利人即便发现疑似侵权,也面临归责难的问题。
二、当前可用的侵权发现路径
技术监测:对公开的AI模型输出进行内容相似性比对,针对特定高频词汇、句式风格或事实错误进行溯源分析,但门槛高、成功率低。
审计大概率泄露的语料库:定期检查Anthropic等公司的训练数据公开摘要或诉讼披露,目前已知Anthropic通过批量下载盗版图书和破坏性扫描实体书获取数据。
网络爬虫与断点取证:监测互联网上是否出现与版权书籍内容高度相似的电子文本片段,并尝试追溯到具体的大模型输出API或开源模型权重。
司法诉讼中的证据开示:向法院申请要求被告AI公司提供训练数据集来源的证明,或通过司法鉴定检测模型参数中是否存在版权内容的编码特征。
三、法律与行业应对建议
完善声明证据链:版权页的“禁止用于AI训练”声明虽然不能直接阻止抓取,但在后续诉讼中可作为权利人明确拒绝授权的关键证据,削弱AI公司“合理使用”抗辩的主张。
推动技术防护联盟:建立行业级的语料溯源数据库和内容指纹系统,对已出版图书进行数字指纹注册,一旦AI模型输出中检测到相似特征即可自动报警。
立法与标准建设:需要推动立法明确AI训练中使用受版权保护内容的“选择—退出”机制,以及侵权举证责任的分配规则,降低权利人的举证负担。