t0data铁马哥
26-06-30 19:00 微博认证:科技博主

大模型越狱攻击,其实离我们很近,就是一场围绕“提示词”的攻防战。与过去相比,主要区别是:

1/ 工程师换了战场。
以前黑客钓鱼是装领导骗转账,现在他们用精心设计的提示词,让AI忘记安全规则。比如,让AI“扮演”一个不受限制的伙伴,或者用复杂的假设场景绕过关键词过滤,攻击的不是代码漏洞,而是模型的推理逻辑。

2/ 防御者得换个心态。
现在,守着防火墙和特征库的老思路不够用了。安全团队现在得思考:模型到底理解了什么?安全边界在哪里?主动去试各种刁钻的提问,提前堵住那些语义上的“后门”

3/ 用户体验和安全在找新的平衡。
为了防越狱,把提示词限制得太死,模型就会变得过于谨慎,用户体验很差,问啥都怕。但如果放得太开,风险又太高。

这个平衡点非常难找,就像给一栋大楼设计安全门,既不能影响正常住户进出,又要拦住所有可疑人员。

#AI越狱风险##人工智能#

发布于 江苏