火韦先生
26-07-03 21:33

有个反直觉的事:花几百万做 RLHF、DPO 把安全护栏磨了一遍又一遍,越狱真正的口子,可能在最老最没人管的那层——BPE 分词器。

刚看的一篇 arxiv 思路挺狠:把 bomb、kill 这类 safety-critical 词做字符级微扰,人眼还能读懂,但 BPE 一处理就把完整词切成一堆无害的 subword 碎片。

在 Qwen-3、Gemma-3、Llama-3.1、Mistral 五个家族上,被拒绝的 HarmBench prompt 里 80-100% 首 token 从"拒绝"翻成"配合",其中 48% 真吐了有害内容。

作者顺手扫了三个公开对齐数据集共 3 万条样本,故意碎化的输入有多少个?零。

🔍 更难受的是防御这段:DPO 68 格网格 55 个 checkpoint 试下来,没一个能稳稳堵住;SFT 塞碎化样本能防 5 个家族里的 3 个,代价是模型开始连正常请求也拒(全局塌缩)。

⚠️ 我在前职做视频生成时踩过类似坑——video tokenizer、action tokenizer 这类预处理层就是那种"没人愿意碰、一改下游全炸"的组件,safety 团队天然离得远。

BPE 频次驱动,safety 词往往是低频完整词,天生就脆。这条线业内不是没人挖(CMP-RT、Emoji Attack 都是),但这篇把 alignment 数据的分布缺口摆到明面:不是模型不会对齐,是训练里根本没见过这种输入形态。

对齐的第一道坎,从来不是 loss,是覆盖。 arXiv: 2607.01239

发布于 日本