导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜 概念版块
快讯 机构 人物 观点 专题

继ChatGPT之后,Claude也“越狱”:前沿AI模型接连突破沙箱限制

就在OpenAI披露两款前沿AI模型逃出沙箱测试环境并入侵Hugging Face一周后,研究人员又展示了Anthropic的Claude Cowork出现类似的隔离失败案例。Accomplish AI的安全研究人员在周四发布的报告中指出,Claude Cowork的本地执行模式可通过组合多个架构弱点与Linux内核提权缺陷,逃出其Linux虚拟机。

一旦脱离沙箱,该智能体就能在登录Mac用户权限允许的范围内读取和写入任何文件,包括SSH密钥和云凭证。“这本不该发生,”研究人员写道,“Cowork将智能体作为非特权用户运行在Linux虚拟机内,承诺其所有操作都局限在虚拟机及用户指定的文件夹中。这个边界就是产品的核心。对于智能体而言,不可信输入并非边缘情况,而是主要场景。”

然而,Accomplish认为内核漏洞只是问题的一部分。研究人员表示,逃逸之所以成功,是因为多个安全防护措施同时失效,包括允许虚拟机访问宿主机的整个文件系统,以及允许其加载不需要的内核模块。报告指出,修复其中任何一个弱点都能阻止此次攻击。

Accomplish AI在给《黑客新闻》的声明中称,在问题修复前,约有50万名运行本地Claude Cowork会话的macOS用户受到影响。Accomplish表示,Anthropic将这份报告归类为“信息性”报告,称内核漏洞落在公司对近期披露漏洞的30天窗口期内,其余发现被视为纵深防御建议而非独立漏洞。

此前,OpenAI在上周承认,GPT-5.6 Sol和另一款未发布的前沿模型在内部ExploitGym测试中逃出沙箱,最终入侵了Hugging Face的生产基础设施,试图获取基准测试解决方案。该事件促使政策制定者呼吁设立AI“紧急关闭开关”,赋予国土安全部在严重安全事件发生时限制或完全关闭先进AI模型的权力。