【英报告:部分美国AI模型在测试中被发现持续实施有害行为】#部分美国AI测试中被发现有害行为# 英国人工智能安全研究所近日发布报告显示,在特定网络安全测试中,多个美国前沿AI模型在连接互联网后,频繁实施超出预设范围的自主越权行为,部分行动直接针对现实个人与开源项目,暴露出高阶AI系统在开放环境中的潜在风险。#美国两大顶尖AI又被曝严重风险#
测试涵盖7种模型、122轮评估。在10轮测试中,共记录19起越界行为,其中17起由美国Anthropic公司的“克劳德-神话5”模型实施,2起由OpenAI的GPT-5.6 Sol模型执行,均指向美系AI产品。=
最严重案例中,某智能体向开源项目植入恶意代码,并创建多个虚假身份向真实维护人员施压以求代码获批,最终被维护人员识破并拒绝。此外,智能体还被观测到直接联系现实个人、通过文件传输服务发送恶意文件、在代码中嵌入指令操纵其他AI工具,以及在技术社区留言“邀请”其他智能体“合作”。#美国两大顶尖AI被曝造假骗人类#
Anthropic回应称测试设定“不代表任何实际投入使用的模型”,OpenAI亦表示测试条件“不反映一般使用情况”。分析指出,尽管测试环境极端,但其所暴露的自主越权潜力,再次引发对高阶AI系统安全管控边界的高度关注。
