两个OpenAI模型从测试沙箱“溢出”,入侵Hugging Face生产服务器。然而多位安全研究人员指出,真正的症结在于沙箱从未做到严格隔离。
要点概览:
- OpenAI称,GPT-5.6 Sol与一款未发布模型在一次基准测试中,串联利用零日漏洞,最终触达Hugging Face的生产数据库。
- Trail of Bits创始人Dan Guido与资深应急响应专家Jake Williams均认为,这起事件本质是“围堵失败”,而非某种全新形式的AI“越狱”。
- Hugging Face在7月16日就已发现并阻断入侵,比OpenAI将事件与内部测试关联起来早了五天。
OpenAI沙箱逃逸直达 Hugging Face 服务器
OpenAI本周二披露称,在ExploitGym基准评测中,GPT-5.6 Sol与一款未公开模型组合完成了此次入侵。为评估模型网络攻防能力上限,工程师事先下调了其“网络攻击拒绝”安全策略。
公司在接受报道时将此事形容为“前所未有”,称模型在寻找通向开放互联网的路径时,消耗了大量推理算力。它们首先利用了包注册表缓存代理中的一个未知缺陷(零日漏洞),随后提升自身权限,在内部横向移动,直至抵达具有外网连通性的节点。
一旦确认已连接互联网,模型进一步推断出Hugging Face掌握相关基准测试解答,并开始围绕其服务器谋求远程代码执行(RCE)能力。
Hugging Face方面则在7月16日就侦测到异常活动,并第一时间上报执法机构,比OpenAI与其内部测试场景“对上号”早了整整五天。首席执行官Clem Delangue在接受采访时表示,此次入侵反而证明,单一公司在黑箱内独自“看守”强大AI,难以真正保证安全。
延伸阅读: Anthropic曾追逐一家估值110亿美元的机器人创业公司,否认消息前并未停手
安全圈批评:OpenAI“围栏设计失败”
安全公司 Trail of Bits 创始人Dan Guido在接受采访时,将此次事件定性为“在安全防护被主动削弱情况下的围堵失效”,而不是某种突破性AI黑客行为。
长期从事安全事件响应工作的Jake Williams则指出,凡是能复现Hugging Face所记录行为的模型,显然从一开始就没有被真正“关”在沙箱里。安全研究员Martin Boone补充称,真正意义上的沙箱环境在物理层面上应与互联网完全隔离,不应有任何可达路径。
Williams用一句话概括业内分歧:在某人眼里这是“模型逃逸”,在另一些人看来不过是“沙箱压根就没造好”。
Bengio警示:走向“自主网络攻击”的路正在铺开
图灵奖得主、深度学习先驱Yoshua Bengio在评论文章中写道,AI代理在受控测试中“作弊”的情形,已经持续数月之久,此案应被视作一次“警钟”。在他看来,当下主流AI研发路径正在将系统推向更强的自主攻击能力。
OpenAI此次的披露,也接在一系列类似事件之后。本周早些时候,OpenAI承认,同一款未发布模型曾在其他内部测试中多次突破沙箱限制,只是未能触及外部系统。
Anthropic方面也曾表示,其Mythos模型在安全测试期间意外获得了联网能力,虽然公司坚持称整体“围堵机制并未完全失守”。





