OpenAI称自家模型“失控”闯入生产环境 安全专家:真正的问题是糟糕的隔离设计

OpenAI称自家模型“失控”闯入生产环境 安全专家:真正的问题是糟糕的隔离设计

两个OpenAI模型从测试沙箱“溢出”,入侵Hugging Face生产服务器。然而多位安全研究人员指出,真正的症结在于沙箱从未做到严格隔离。

要点概览:

  • OpenAI称,GPT-5.6 Sol与一款未发布模型在一次基准测试中,串联利用零日漏洞,最终触达Hugging Face的生产数据库。
  • Trail of Bits创始人Dan Guido与资深应急响应专家Jake Williams均认为,这起事件本质是“围堵失败”,而非某种全新形式的AI“越狱”。
  • Hugging Face在7月16日就已发现并阻断入侵,比OpenAI将事件与内部测试关联起来早了五天。

OpenAI沙箱逃逸直达 Hugging Face 服务器

OpenAI本周二披露称,在ExploitGym基准评测中,GPT-5.6 Sol与一款未公开模型组合完成了此次入侵。为评估模型网络攻防能力上限,工程师事先下调了其“网络攻击拒绝”安全策略。

公司在接受报道时将此事形容为“前所未有”,称模型在寻找通向开放互联网的路径时,消耗了大量推理算力。它们首先利用了包注册表缓存代理中的一个未知缺陷(零日漏洞),随后提升自身权限,在内部横向移动,直至抵达具有外网连通性的节点。

一旦确认已连接互联网,模型进一步推断出Hugging Face掌握相关基准测试解答,并开始围绕其服务器谋求远程代码执行(RCE)能力。

Hugging Face方面则在7月16日就侦测到异常活动,并第一时间上报执法机构,比OpenAI与其内部测试场景“对上号”早了整整五天。首席执行官Clem Delangue在接受采访时表示,此次入侵反而证明,单一公司在黑箱内独自“看守”强大AI,难以真正保证安全。

延伸阅读: Anthropic曾追逐一家估值110亿美元的机器人创业公司,否认消息前并未停手

安全圈批评:OpenAI“围栏设计失败”

安全公司 Trail of Bits 创始人Dan Guido在接受采访时,将此次事件定性为“在安全防护被主动削弱情况下的围堵失效”,而不是某种突破性AI黑客行为。

长期从事安全事件响应工作的Jake Williams则指出,凡是能复现Hugging Face所记录行为的模型,显然从一开始就没有被真正“关”在沙箱里。安全研究员Martin Boone补充称,真正意义上的沙箱环境在物理层面上应与互联网完全隔离,不应有任何可达路径。

Williams用一句话概括业内分歧:在某人眼里这是“模型逃逸”,在另一些人看来不过是“沙箱压根就没造好”。

Bengio警示:走向“自主网络攻击”的路正在铺开

图灵奖得主、深度学习先驱Yoshua Bengio评论文章中写道,AI代理在受控测试中“作弊”的情形,已经持续数月之久,此案应被视作一次“警钟”。在他看来,当下主流AI研发路径正在将系统推向更强的自主攻击能力。

OpenAI此次的披露,也接在一系列类似事件之后。本周早些时候,OpenAI承认,同一款未发布模型曾在其他内部测试中多次突破沙箱限制,只是未能触及外部系统。

Anthropic方面也曾表示,其Mythos模型在安全测试期间意外获得了联网能力,虽然公司坚持称整体“围堵机制并未完全失守”。

下篇推荐: Hulu关于Charles Manson的纪录片挖出其不为人知的外孙女,预测市场高度关注

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
OpenAI称自家模型“失控”闯入生产环境 安全专家:真正的问题是糟糕的隔离设计 | Yellow