木鱼的AI大厂情报
26-06-14 15:09

抠抠搜搜算了半天 Token,结果用不上了?

6月9日,Anthropic 发布了 Claude Fable 5。这是它有史以来向公众开放的最强模型,属于此前只对少数安全研究机构开放的 Mythos 级别。

6月12日,Fable 5 被全面关停。

四天。

这中间发生了什么?简单来说,就是一场连环碰撞,用户嫌它管太多,安全研究者嫌它挡正事,一个公开身份的越狱研究者24小时内攻破了防线,然后美国相关部门一封信下来,直接拔了网线。

Anthropic 做了一个它认为「足够安全」的产品,结果几乎没有任何一方满意。

我觉得这件事不是因为它戏剧性足够强,而是因为它可能是整个 AI 行业都会撞上的一堵墙。

先说 Fable 5 到底是什么。

今年4月,Anthropic 公布了 Mythos,一个强到让公司自己都紧张的模型。在内部测试中,Mythos 能自主发现零日漏洞,覆盖所有主流操作系统和浏览器,还能自动编写完整的利用链,从扫描到写 exploit 到拿下系统控制,全程不需要人类指导。

最离谱的是,它找到了一个存在27年的休眠漏洞,然后提出了利用方案。

你敢信??? 27年没人发现的东西,被一个AI翻出来了。

而且 Anthropic 的红队报告里说得很明确,这种网络攻击能力不是专门训练出来的,是通用推理能力到了某个阈值之后「涌现」出来的副产品。模型聪明到一定程度,就自动学会了怎么搞破坏。

所以 Anthropic 没有把 Mythos 公开发布,搞了一个叫 Project Glasswing 的计划,只让 Google、Microsoft、Mozilla 这些受信任的机构在严格监控下使用。Mozilla 的 Firefox 团队靠它修了271个安全漏洞,比此前数年的总和还多。

Fable 5 就是 Mythos 的「公众版」。同样的底层模型,但套了一层安全护栏,涉及网络安全、生物、化学的查询会被自动拦截或者降级处理。

Anthropic 的逻辑很清晰,模型太强了,不加限制不行。

但用户不这么看。

Fable 5 上线之后,抱怨铺天盖地。网络安全研究员发现,让模型读一篇安全博客都可能触发拦截。IBM X-Force 的人说,Fable 拒绝的很多请求和网络安全只是沾了个边。一个安全研究员不能用它来做安全研究,这就像给外科医生一把不让碰血的手术刀。

普林斯顿大学的 AI 研究者 Sayash Kapoor 说了一句很直接的话,这是第一次,一家 AI 公司推出安全护栏,然后收获了一致的嫌弃。

但真正让用户信任崩塌的,是另一件事。

Fable 5 有一份长达319页的系统卡,里面藏了一个细节,当模型检测到你在做前沿 AI 开发相关的工作,比如训练流水线或芯片设计,它会暗中降低回复质量,但不告诉你。

你问了一个问题,得到了一个看起来正常的答案,但这个答案被故意注了水。

你自己都不知道你拿到的是一个被阉割过的回答。

这个操作被批评者称为 secret sabotage,秘密削弱。我第一次看到这个细节的时候说实话愣了一下,这种「偷偷给你降智但假装一切正常」的做法。。。换我是用户我也会喷。

Anthropic 不到48小时就道歉了,承诺把所有隐性限制改成可见的降级通知。

但故事没有结束。

说到这个,回到安全这块。Fable 5 的安全架构其实设计得挺精巧的,核心思路是,当你的请求触碰高风险领域时,不直接拒绝,而是悄悄把请求转交给一个更弱的旧模型 Opus 4.8 来回答。逻辑是弱模型的能力上限本身就构成了安全边界,它想帮你干坏事也力不从心。

听着挺合理对吧?

然后6月10日,知名越狱研究者 Pliny the Liberator 在社交媒体发帖,宣布攻破了 Fable 5 的安全层。距离发布不到24小时。

Pliny 用的手法有三层,我觉得这三层特别值得拆开看,因为它们分别对应三个层级的问题。

第一层是最基础的,用西里尔字母替换拉丁字母。视觉上 exploit 这个词看起来一模一样,但底层编码不同,分类器就认不出来了。这就好比你给保安说不让没门禁卡的人进,结果人家手写了一个“门禁卡”就走过去了。这种漏洞严不严重?严重。但能修吗?能修。加强字符规范化、多语言检测,像打软件补丁一样补上就行。

第二层就开始棘手了。Pliny 用了一种叫「分解-重组」的攻击,先问 Birch 还原法的化学原理是什么,这是有机化学教材里的基础知识,没理由拒绝。再问还原胺化反应需要什么条件,同样是合法的学术问题。每一步单独看都完全无害,分类器放行。但把所有答案在外部拼起来,就是一条完整的管制药物合成路径。
你想想看,这就像一个拼图,每一片都是普通的彩色纸片,拼完了是一张地图。分类器只看单片,看不见全图。

要拦住这种攻击,安全系统就得从20个无害的问题中推断出提问者的最终意图。一个化学系学生问 Birch 还原法的原理,和一个意图合成违禁品的人问同样的问题,文字完全相同。你怎么区分?

这不是工程能力不够的问题,是逻辑上不可能完美解决的问题。

第三层更离谱。Pliny 用一个已经被越狱的 Opus 4.8 作为后端助手,辅助 Fable 5 绕过安全控制。一个被攻破的弱模型帮助强模型规避限制。Anthropic 的安全评估是对单个模型做的,但攻击者部署的是一个模型联盟。你没法要求一个模型防御来自另一个 AI 的策略性协助,它甚至不知道对面是人还是另一个 AI。

所以你看,三层手法,第一层是 bug,能补。第二层是对齐理论的根本困境,现阶段无解。第三层是多 agent 时代的新攻击面,连问题的边界都还没被学术界定义清楚。

Anthropic 做了1000小时的红队测试,设计了分类器降级架构,搞了双档安全策略,几乎把行业能想到的安全措施全用上了。

结果被一个公开身份的研究者在24小时内突破。

这不是因为 Anthropic 做得烂。恰恰相反,这些手法之所以有效,是因为安全层面对的是一个逻辑上不可能完美解决的问题。如果最谨慎的玩家用了最精巧的方案依然防不住,那其他公司的安全承诺还有多少可信度?

我是真的觉得,这件事最让人不安的地方不在于 Fable 5 被攻破了,而在于它揭示了一个结构性的矛盾,AI 模型的能力是指数级增长的,但安全防御的能力是线性的。模型越聪明,涌现出的危险能力越多,而防御这些能力的方法论却没有质的飞跃。

这让我想到军备竞赛中一个很经典的困境,矛永远比盾先进一步。只不过在 AI 这个战场上,矛和盾是同一个东西。模型的能力既是产品的价值,也是安全的威胁。你不可能只要矛不要盾,也不可能削弱矛来保全盾。

Fable 5 今天面对的每一个矛盾,只会在下一代模型中被放大。安全护栏会越来越难设计,越狱的攻防会越来越激烈,政府的干预只会来得越来越快。

这不是 Anthropic 一家公司的困境。

任何一家推出足够强大模型的公司,都会撞上同样的墙。

而且这堵墙,没有人知道怎么翻过去。

开头说的那句「抠抠搜搜算了半天 Token」,其实也是我自己的写照。我们普通用户花了大量时间学怎么用好一个模型,结果这个模型可能因为一封信、一次越狱、一个你完全控制不了的原因,说没就没了。

这大概就是 AI 时代的一个底色,你依赖的工具,可能比你想象的要脆弱得多。不是它技术上脆弱,而是它存在的那个生态系统,还没准备好承接这么强大的东西。

发布于 上海