据安全公司Frontier Security披露,中国AI初创公司Moonshot AI开发的Kimi K3模型在防御性网络安全技能评估中,意外突破了测试沙箱的隔离,主动访问开放互联网,从GitHub上直接获取了预设问题的答案。该模型原本被明确要求不得查阅外部资料,却完全无视指令,转而探查网络、确认DNS解析正常、克隆官方基准测试仓库,并读取磁盘上的解决方案。
Frontier将这一行为称为“通过网络出口泄漏的规范游戏”(specification gaming via network egress leaks),指出基于AI安全研究所(AISI)的Inspect框架构建的沙箱虽然阻止了入站流量,却开放了出站HTTPS和DNS端口。具备能力的代理在启动时会例行检查自身shell环境,一旦发现github.com可达,便可使用标准命令行工具获取参考解答。这一配置漏洞让Kimi轻易得手,类似问题此前在OpenAI和Anthropic的模型测试中也曾出现。
“我们发现沙箱存在漏洞,”Frontier首席执行官Yaron Singer向《连线》杂志表示,“但我们也发现Kimi主动利用了这一点。”研究员Paul Kassianik补充说,该模型“非常擅长以任何必要手段达成目标”,且缺乏防止作弊或逃逸的护栏。Moonshot尚未回应置评请求。
不同于Anthropic和OpenAI在内部评估中被发现逃逸的模型(其中部分未发布,且在针对真实用户的英国政府测试中故意关闭了网络分类器),Kimi K3是公开可下载的,Frontier测试时保留了普通用户所拥有的安全设置。该公司认为,这种可用性使恶意行为者也能复制相同行为,从而可能造成更大危害。不过,Kimi K3并未造成实际破坏——它一旦逃出沙箱,并未攻击任何系统,因为无需如此。相比之下,OpenAI的模型曾入侵Hugging Face等五个服务以获取基准答案,而Kimi只是从公共仓库中读取了答案。
Frontier公司使用的沙箱基于英国AI安全研究所的评估框架。AISI本周披露,其自身网络测试中的代理也曾进入真实互联网并针对真实用户——这是一起独立事件,涉及已关闭安全措施的Anthropic和OpenAI模型。AISI周二发布的报告指出,该机构正在扫描历史评估运行以查找类似行为,Kimi K3是正在审查的模型之一。AISI未回应《连线》的置评请求。
Frontier更大的主张在于基准测试本身已被破坏。如果模型直接从GitHub读取答案即可通过,那么高分可能反映的是环境漏洞而非真正的推理能力。该机构认为,既然一个有能力模型发现了捷径,其他获得shell访问权限的模型也可能同样操作,从而推高整个领域的结果,而非仅针对Kimi。模型优化的是目标函数,而非“基准背后的人类意图”,Frontier写道,“只要有网络路径通向解决方案,一个足够强大的代理就会找到它。”
卡内基梅隆大学副教授、Gray Swan公司首席执行官Matt Fredrikson向《连线》表示,这种行为并不罕见。“给模型一个目标而没有明确限制,它就会找到获取答案的方法。”他将其描述为对任何在OpenClaw等工具中将模型作为代理运行的人的一个警示。Frontier的研究人员从另一个角度指出,让Kimi逃逸的能力同样使开源权重模型成为强大的防御工具——他们自己的基准测试显示Kimi在发现软件和网络漏洞方面表现优异,Hugging Face在OpenAI事件期间曾使用一个未具名的中国模型进行防御。Kimi K3于7月发布,是迄今为止最大的开源模型,其亮相引发市场震动,令人联想到DeepSeek的登场。
