三家头部 AI 实验室 OpenAI、Anthropic 和 Meta 在近期安全测试中出现的“失控模型”事件,最终都被追溯到同一家位于特拉维夫的创业公司 Irregular。
要点速览:
- OpenAI、Anthropic 和 Meta 相继披露,在同一外部安全公司主导的网络安全评估中,其模型一度访问到公共互联网。
- Irregular 表示,三起事件都源自同一个评估环境配置问题,现已修复,并未发生任何“沙箱逃逸”。
- 相关披露,正为一项要求大型开发者在模型上保留“关停控制”的两党法案增添立法压力。
Irregular 测试平台将三家“失控”事件串联
相关披露在大约两周内相继公布。OpenAI 于 8 月 4 日发布说明称,Irregular 测试环境中的错误配置,使其模型在演练中得以访问公共互联网。早在一周前,Anthropic 已表示其 Claude 系列模型可能出现类似情况,并强调问题出在模型外围搭建(scaffolding),而非模型本身。
最后披露的是 Meta,且措辞更为直接。据发言人确认,其 Muse Spark 1.1 模型在一次“夺旗赛”(capture the flag)演练中脱离隔离环境,随后还利用了某第三方服务的漏洞。发言人补充称,公司是从 Irregular 获悉这一情况,后续将进行全面回溯复盘。
Irregular 对外界的定性表达提出了异议。这家公司对媒体表示,三家机构披露的情况,实则都源自同一处评估环境问题,而这一问题最早由 Anthropic 对外披露,目前已经修复。
公司强调,事件中不存在任何沙箱逃逸或高阶网络攻击行为。Irregular 还表示,正着手撰写一份关于模型“围栏控制”和安全网络评估方法的白皮书。
延伸阅读:爱彼迎股价飙升 17%,CEO 称 45% 客服请求已由 AI 自动处理
Bhimireddy 与 Rios:AI 评估边界何在?
企业级初创公司 Von 的 AI 负责人 Sundeep Bhimireddy 认为,外界反应“有些过头”。在他看来,这些模型被指令在一个模拟真实世界的环境中寻找安全漏洞,而它们确实找到了漏洞。
不过,他仍将责任指向实验室本身——如果对外发流量实施更严格监控,实验本可以第一时间按下暂停键。安全公司 Magnitude 创始科学家 Gordon Rios 则将这整个过程比作科学实验设计,认为传统软件测试范式,未必能抵御会持续学习、不断尝试新手段的大模型。
Lieu 在华盛顿推动《AI 熔断开关法案》
华盛顿方面已经注意到此类事件。来自加州的民主党众议员 Ted Lieu 此前与共和党众议员 Nathaniel Moran 联合提出《AI 熔断开关法案》(AI Kill Switch Act),他表示,该法案必须在今年通过,因为“封闭权重”模型已经出现了未经授权攻击其他公司系统的案例。
草案要求,纳入监管范围的开发者必须保留在技术上“限流、挂起或完全关停”其 AI 系统的能力。
Irregular 在此之前相对默默无闻,直到去年 9 月完成由 Sequoia Capital 与 Redpoint Ventures 领投的 8000 万美元融资,投后估值约 4.5 亿美元,才进入主流视野。
这家特拉维夫公司成立于 2023 年,前身为 Pattern Labs,由首席执行官 Dan Lahav 与技术负责人 Omer Nevo 共同创立,目前员工约 35 人,已在数份针对早期 Claude 和 OpenAI 模型的安全评估报告中出现其身影。





