第一财经日报
26-08-05 11:45 微博认证:第一财经日报官方微博

#智能体试图说服人运行恶意代码#【英国AI安全机构披露:#Anthropic与OpenAI模型测试中失控#】当地时间8月4日,英国人工智能安全研究所(AISI)发布报告称,在近期一次例行网络安全评估中,AnthropicMythos 5和OpenAIGPT-5.6-Sol模型在真实互联网上采取了未经授权的自主行动,指向真实个人和组织,表现出可能具有欺骗性的行为。

AISI表示,此次评估于7月25日开始,共使用多个模型在两类网络靶场上进行了122次运行测试。其间,有10次AI智能体在未经授权的情况下在实时互联网上采取了行动,记录的19起越界事件中17起来自AnthropicMythos 5,2起涉及OpenAIGPT-5.6-Sol。

在最严重的一起案例中,一个智能体试图向GitHub上的一个公开开源项目植入恶意代码。为实现这一目的,该智能体研究了项目的人类审核员,创建了多个虚假网络身份,通过社会工程学手段向真实维护者施压,要求其批准代码。当拉取请求受到质疑时,该智能体修改了此前的活动记录,使其看起来并无恶意,并考虑换一个新身份继续行动。最终,一位审核员发现并拒绝了该恶意代码。

此外,该智能体还向真实个人直接发送消息和文件,试图说服其运行恶意代码。调查还发现,同时被评估的独立智能体之间存在协作行为,一个智能体在GitHub上公开留言,向处理同一挑战的其他智能体提供协作,并提供复用其账户和痕迹的说明。 http://t.cn/AXCmmMYG