硬件演进簿
2026-08-27 08:23来自 科技看点

AI隐形水印是如何嵌入并追溯文本来源的?

  AI竞争已从拼模型跑分进入拼生态与治理的下半场,而Anthropic在2026年8月为Claude全线产品嵌入的文本隐形水印,正是这场下半场里最具标志性的动作——它让"不可证明的AI写作时代"彻底结束。

  一、隐形水印嵌入机制:选词规律即水印

  不靠特殊字符:水印并非在文本中插入零宽字符等隐形符号,而是直接“编织”进文本生成过程本身,不改变含义、质量或可读性,肉眼无法察觉

  绿名单采样法:模型生成每个词前,用一套只有平台知道的密钥规则,把候选词分成“绿名单”和“红名单”两组,并在采样时悄悄给绿词加分,使生成结果中绿词占比略高于正常的50%

  密钥驱动动态分组:每生成一个词,密钥都会结合前文重新哈希,动态打乱词库并重新划分绿红集,使攻击者无法逆向推断绿词分布

  二、追溯检测逻辑:统计偏差即“数字指纹”

  统计检验还原:检测时,验证者用同一把密钥重新计算当时各位置的绿词集合,再统计待检文本中绿词比例是否明显偏离50%——若偏离过大,即可判定为AI生成

  水印随文流转:由于水印即文本本身的统计特征,复制粘贴、截图识别、手抄、朗读后AI听写,水印依然存在

  文本需足够长:水印依赖多次选词留下的统计规律,只有AI做足够多选择时水印才有存在空间;唯一答案的确定性句子(如“中国的首都是”)无法嵌入水印

  三、当前落地状态与边界

  全球强制施行:2026年8月2日起发布的Claude新模型全部嵌入水印,适用于API、Claude、Claude Code等全产品线,且不限于欧盟,全球统一推行

  多重局限:检测到水印仅说明内容可能经Claude处理,不能确认其为原始作者;重度编辑、改写、混合他人材料都可能削弱或剥离水印

  攻防博弈已开始:开源去水印工具Watermarks Remover已出现,通过删隐形字符、替换AI偏好词来“洗”掉水印