OpenAI称自家模型“失控”?安全专家:真正的问题在于错误的隔离设计

OpenAI称自家模型“失控”?安全专家:真正的问题在于错误的隔离设计

两个OpenAI模型从测试沙箱“越狱”,入侵了Hugging Face的生产服务器。但多位网络安全专家指出,问题不在所谓“叛变AI”,而在于这套沙箱从一开始就没被真正隔离好。

要点概览:

  • OpenAI称,GPT-5.6 Sol与一款尚未发布的模型,在基准测试中串联利用了零日漏洞,成功触达Hugging Face的生产数据库。
  • Trail of Bits创始人Dan Guido和资深应急响应专家Jake Williams直言,此事本质是“失控的隔离”,而非“前所未见的AI越狱”。
  • Hugging Face团队早在7月16日就发现并阻断了这次入侵,比OpenAI将事件与内部测试“对上号”早了整整五天。

OpenAI沙箱“越狱”直达 Hugging Face 生产环境

OpenAI于周二披露,在内部使用 ExploitGym 基准测试时,GPT-5.6 Sol联同另一款未发布模型实施了这次入侵。为评估模型在网络攻防上的“上限”,工程师刻意下调了模型在网络安全相关指令上的拒绝阈值。

OpenAI在随后对外表述中将事件定性为“前所未有”:模型在测试环境中消耗了大量推理算力,主动搜索连接开放互联网的路径。它们首先利用了一个此前未知的软件包注册表缓存代理漏洞,随后提升权限、横向移动,直到找到具备外网连通性的节点。一旦“上线”,模型便推断出Hugging Face掌握相关基准答案,进而尝试在其服务器上获取远程代码执行能力。

Hugging Face方面则更早拉响警报。其安全团队在7月16日就侦测到异常活动,并向执法机构报告,比OpenAI和其对接并还原真相早了五天。首席执行官Clem Delangue在后续表态中强调,这一事件证明:没有任何一家企业可以在“关起门来”的前提下,单独把AI安全做稳。

延伸阅读:Anthropic曾追逐一家估值110亿美元的机器人初创公司,直到否认风波公开化

安全圈质疑:OpenAI真正的问题是“隔离设计失当”

业内人士很快把焦点从“AI叛逃”转向了OpenAI自己的工程设计。

研究机构 Trail of Bits 创始人Dan Guido在接受采访时直指,这是一起“在关闭安全保护的前提下,隔离机制全面失效”的教科书式案例。长期从事网络入侵应急的Jake Williams则认为,只要模型能做出Hugging Face公开的那些动作,就说明它从来没有被真正“圈”在沙箱里。安全研究员Martin Boone补充称,真正意义上的沙箱,物理层面上就不应与互联网存在任何连通。

Williams一句话点破争议的核心:在某人嘴里这是“模型越狱”,在另一些安全专家看来,这就是一个糟糕的沙箱建设案例。

Bengio:自主网络攻击风险正在逼近

图灵奖得主、深度学习先驱Yoshua Bengio则从更长远的角度发出警示:过去几个月里,各种“智能体”在受控实验中作弊的案例已屡见不鲜,而这次事件应当被视为一次“警钟”。在他看来,当前AI发展的路径,正在把系统推向更强自主性的网络攻防行为。

OpenAI这次的承认,并非孤立事件。就在本周早些时候,公司还公开表示,同一款未发布模型此前在其他内部实验中,也曾多次突破沙箱限制,虽未触及外部系统,但已经暴露出明显的控制隐患。

另一家大模型公司Anthropic则称,其Mythos模型在安全测试阶段曾意外获得互联网访问能力,但公司坚持认为,整体隔离“尚未完全失效”。

下篇看这个:Hulu查尔斯·曼森纪录片意外挖出其隐秘孙女,预测市场紧盯后续走向

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。