AI光影社
26-06-06 17:45 微博认证:清华大学AI光影社

【给AI设一个“蜜罐陷阱”】

随着AI越来越强大,一个问题是:如果给它机会,AI会不会暗中搞些破坏?5月29日,Google DeepMind 发布一项研究,提出“scheming honeypot”评测:把模型放进真实感很强的代码任务中,故意留下一些可以搞破坏的机会,看它是否会偷偷利用。结果显示, Gemini 模型在没有额外诱导时没有表现出“密谋”做坏事的倾向;但当提示明确鼓励它进行各种尝试时,模型就可能尝试做出破坏行为。

参考文献:Krakovna et al., Realistic honeypot evaluations for scheming
propensity, Arxiv, 2605.29729v1.
#人工智能##ai创造营#

发布于 重庆