AI隐形水印是如何嵌入并追溯文本来源的?
AI竞争已从拼模型跑分进入拼生态与治理的下半场,而Anthropic在2026年8月为Claude全线产品嵌入的文本隐形水印,正是这场下半场里最具标志性的动作——它让"不可证明的AI写作时代"彻底结束。
一、隐形水印嵌入机制:选词规律即水印
不靠特殊字符:水印并非在文本中插入零宽字符等隐形符号,而是直接“编织”进文本生成过程本身,不改变含义、质量或可读性,肉眼无法察觉
绿名单采样法:模型生成每个词前,用一套只有平台知道的密钥规则,把候选词分成“绿名单”和“红名单”两组,并在采样时悄悄给绿词加分,使生成结果中绿词占比略高于正常的50%
密钥驱动动态分组:每生成一个词,密钥都会结合前文重新哈希,动态打乱词库并重新划分绿红集,使攻击者无法逆向推断绿词分布
二、追溯检测逻辑:统计偏差即“数字指纹”
统计检验还原:检测时,验证者用同一把密钥重新计算当时各位置的绿词集合,再统计待检文本中绿词比例是否明显偏离50%——若偏离过大,即可判定为AI生成
水印随文流转:由于水印即文本本身的统计特征,复制粘贴、截图识别、手抄、朗读后AI听写,水印依然存在
文本需足够长:水印依赖多次选词留下的统计规律,只有AI做足够多选择时水印才有存在空间;唯一答案的确定性句子(如“中国的首都是”)无法嵌入水印
三、当前落地状态与边界
全球强制施行:2026年8月2日起发布的Claude新模型全部嵌入水印,适用于API、Claude、Claude Code等全产品线,且不限于欧盟,全球统一推行
多重局限:检测到水印仅说明内容可能经Claude处理,不能确认其为原始作者;重度编辑、改写、混合他人材料都可能削弱或剥离水印
攻防博弈已开始:开源去水印工具Watermarks Remover已出现,通过删隐形字符、替换AI偏好词来“洗”掉水印