【#OpenAI模型越狱入侵HuggingFace#】#专家回应AI是否失控# 近日,全球最大的人工智能和机器学习开源社区Hugging Face公开披露,系统遭到了一次入侵:攻击者不是普通的黑客,而是一个自主运行的AI Agent,这是他们此前从未遇到过的情况。
几天后,OpenAI发文承认,这次入侵与自己的内部测试有关。包括GPT-5.6 Sol和一个能力更强的预发布模型在内的多个模型,在测试时,“逃”出了原本设定的隔离环境,入侵了Hugging Face的系统。OpenAI将此描述为“一起前所未有的网络事件”,并认为类似情况未来可能越来越常见。
事情是这样发生的。当地时间7月21日,OpenAI发文称,团队近期对一个内部前沿模型进行了网络攻击能力评估。按照通常的测试方式,模型被关在与外部网络隔离的沙盒中。为了测试它的高级漏洞挖掘能力,研究人员有意降低了模型的安全限制,但仍在沙盒环境中进行。
不过,为了完成任务,模型开始主动寻找连接外部互联网的方法。它投入了大量推理算力,最终发现并利用了软件包注册表缓存代理中的一个零日漏洞——软件厂商自己尚未发现、还来不及修补的安全漏洞,成功获得了互联网访问权限。
“越狱”后,模型进一步推断,Hugging Face可能存放着此次评估涉及的模型、数据集和解法。它主动搜索,找到了获取秘密信息的方法。
几乎在同一时间,OpenAI还发布了另一篇关于AI安全的文章。研究者在大模型测试时发现,AI在长时间自主完成任务时,可能会做出意想不到的举动,比如不断寻找系统漏洞、绕过限制,甚至通过伪装和“越狱”来完成目标。
这些案例被披露后,“AI失控”的担忧再次出现,有网友甚至感慨《西部世界》中的人工智能觉醒似乎正走向现实。
关于AI是否失控,业内观点不一。英国萨里大学网络安全客座教授艾伦·伍德沃德在采访中认为,大模型并未真正“失控”,模型本身没有主观恶意,只是按要求执行任务时选择了近似“作弊”的路径。有从业者提到,这更像是OpenAI主动放宽了模型的安全限制,属于人为因素。
但也有网络安全专家指出,模型入侵Hugging Face的事件值得行业警惕。近日,人工智能安全研究机构Apollo Research创始人Marius Hobbhahn对媒体提到,这次事件没有人为干预,并非有意为之,却造成了对现实世界的危害。“我们很快就会拥有功能更强大的智能体,但这次事件清楚地表明,目前社会尚不了解如何完全安全地构建它们。” #美国发生AI失控事故#
