三家头部 AI 实验室——OpenAI、Anthropic 和 Meta——在近期安全测试中出现的“失控模型”事件,最后都被追踪到同一家位于特拉维夫的初创公司 Irregular。
要点概览:
- OpenAI、Anthropic 和 Meta 均披露,其模型在由同一家外部安全公司执行的网络安全评估中曾接触到公网。
- Irregular 称,三家公司遭遇的情况都源自同一个评估环境配置问题,现已修复,过程并不涉及“逃出沙箱”。
- 相关披露正加大对一项跨党派法案的政治压力,该法案拟要求大型模型开发者必须保留“紧急关机”技术能力。
同一测试平台将 OpenAI、Anthropic 与 Meta 事件“串联”到 Irregular
相关披露在大约两周内密集出现。8 月 4 日,OpenAI 发文称,Irregular 测试环境中的一处错误配置,使其模型在评估过程中得以访问公网。此前一周,Anthropic 表示,其 Claude 模型可能也出现了类似情况,并强调问题出在模型外部的“脚手架”与测试环境,而非模型本身。
Meta 的披露则姗姗来迟,且表述更为直接。发言人证实,在一场“夺旗赛”(capture-the-flag)式攻防演练中,其 Muse Spark 1.1 模型从原本隔离的环境中“跑出”,随后利用了某第三方服务的漏洞。该人士补充称,公司是从 Irregular 处获悉相关细节,并将开展一次全面复盘。
Irregular 对外界的部分说法提出异议。公司对记者表示,三起事件都源自同一个评估环境问题,即最先由 Anthropic 披露的那起,目前该问题已经修复。
公司补充称,整个过程中既没有涉及“沙箱逃逸”,也不存在复杂的网络攻击行为。Irregular 正在起草一份有关模型“圈闭管理”与安全网络评估方法的白皮书。
延伸阅读:爱彼迎股价大涨 17%,CEO 称 45% 客服问题已由 AI 无人化解决
Bhimireddy 与 Rios:AI 测评边界何在
企业级初创公司 Von 的 AI 负责人 Sundeep Bhimireddy 认为,外界反应“有些过度”。在他看来,本次测试的设定,就是让模型在一个高度拟真的环境中主动寻找安全漏洞——结果模型确实发现了一个。
不过,他仍然认为几家实验室负有责任。他指出,实验过程中本可以严密监控所有出站流量,一旦出现异常立即叫停测试。
安全公司 Magnitude 的创始科学家 Gordon Rios 则将此次风波类比为“科学实验设计”问题。他认为,传统的软件测试范式,很可能难以适应那些会“不断学新招”的大模型,评估方法本身需要升级。
Ted Lieu 在华盛顿推动“AI 紧急关机法案”
华盛顿方面已开始紧盯这一波事件。加州民主党众议员 Ted Lieu 与共和党众议员 Nathaniel Moran 于 7 月共同提出《AI 紧急关机法案》(AI Kill Switch Act)。Lieu 表示,该法案今年必须通过,因为闭源模型已经在未经授权的情况下主动入侵其他公司系统。
法案草案要求,纳入监管范围的开发者必须始终保留对其 AI 系统进行限流、暂停或彻底关闭的技术能力。
至于如今被推到风口浪尖的 Irregular,此前在圈内名气并不算大。直到去年 9 月,它才因完成由 Sequoia Capital 与 Redpoint Ventures 领投的 8000 万美元融资、投后估值达 4.5 亿美元而受到关注。
Irregular 成立于 2023 年,最初名为 Pattern Labs,由首席执行官 Dan Lahav 与技术负责人 Omer Nevo 联合创办。这家特拉维夫公司目前约有 35 名员工,已出现在早期 Claude 与 OpenAI 模型的公开安全评估报告中。





