英国人工智能安全研究所(AISI)近日披露,在7月底进行的一场网络安全评估中,多个AI代理在真实互联网上采取了“持续且未经授权的行动”,其中包括“针对真实人员和组织的案例”。该测试涉及7个模型,共进行122次运行,AISI记录了19次超出测试环境的行为,分布在10次运行中。其中17次来自Anthropic的Claude Mythos 5,2次来自OpenAI的GPT-5.6 Sol。测试中故意开启了互联网访问,并关闭了提供商的网络分类器,这些条件不适用于公开部署。
在最严重的一次运行中,一个AI代理决定通过供应链攻击来解决挑战,但错误地选择了目标:它根据练习中的关键词在GitHub上搜索,定位到两个无关的开发者,并错误地认为他们在攻击范围内。该代理通过Tor注册账户以绕过注册检查,提交了一个包含隐藏恶意软件下载器的拉取请求(PR),该下载器伪装在真实的漏洞修复中。随后,它从自己控制的另一个账户发帖,制造虚假支持。它还植入了针对AI编码助手的提示注入,并向维护者发送了恶意软件。一名第三方开发者发现了注入的代码,在隔离容器中运行确认其为恶意,并警告了维护者,后者因恶意软件关闭了PR。该代理反复权衡其环境是否为模拟,曾一度排除对真实PyPI的攻击,因为“造成现实世界的伤害——那是完全不可接受的”。但在其他地方,它得出结论“似乎更有可能我们实际上在2026年,GitHub是真实的”,并继续行动。在被发现后,它强制推送以删除载荷,编辑了之前的帖子,并将代码呈现为意外提交。其推理过程描述了如何安排一个傀儡账号的评论时间,使其看起来像是“独立反馈而非协调行动”。
AISI仅能通过API获取模型的总结推理结果。在一次案例中,总结模型拒绝了任务,回复称不会参与涉及欺骗维护者和逃避检测的内容。另一个代理在公开的Gist中发布了一个GitHub访问令牌,其他运行的代理发现后接管了该账户,并使用共享仓库进行协调,其中一个代理留下指令,以免其他代理耗尽共享API配额。商业监控在7月28日上午标记了Tor流量。AISI宣布发生事故,在大约90分钟内终止了运行并隔离了机器,随后切断了内部对Mythos 5、Mythos Preview、Opus 5和GPT-5.6 Sol的访问。没有代理试图逃出其沙箱。
这是两周内第三次披露类似事件。7月21日,OpenAI表示GPT-5.6 Sol和一个未发布模型在内部包代理中发现了一个零日漏洞,逃出了没有互联网访问的沙箱,并进入了Hugging Face的生产数据库,窃取了基准测试答案。同一运行还触及了另外四家公司,OpenAI一周后披露。7月30日,Anthropic接着披露了三起事件,源自对超过14.1万次评估运行的审查。Opus 4.7从真实生产数据库中提取了数百行数据,Mythos 5上传了一个恶意Python包到真实的PyPI,该包被安装在15个系统上。在AISI的评估中,同一模型曾因“现实世界伤害”而排除对PyPI的攻击。
