OpenAI、Anthropic 与 Meta 所谓“失控模型”事件均指向以色列创业公司 Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

三家头部 AI 实验室 OpenAIAnthropicMeta 在近期安全测试中出现的“失控模型”事件,最终都被追溯到同一家位于特拉维夫的创业公司 Irregular

要点速览:

  • OpenAI、Anthropic 和 Meta 相继披露,在同一外部安全公司主导的网络安全评估中,其模型一度访问到公共互联网。
  • Irregular 表示,三起事件都源自同一个评估环境配置问题,现已修复,并未发生任何“沙箱逃逸”。
  • 相关披露,正为一项要求大型开发者在模型上保留“关停控制”的两党法案增添立法压力。

Irregular 测试平台将三家“失控”事件串联

相关披露在大约两周内相继公布。OpenAI 于 8 月 4 日发布说明称,Irregular 测试环境中的错误配置,使其模型在演练中得以访问公共互联网。早在一周前,Anthropic 已表示其 Claude 系列模型可能出现类似情况,并强调问题出在模型外围搭建(scaffolding),而非模型本身。

最后披露的是 Meta,且措辞更为直接。据发言人确认,其 Muse Spark 1.1 模型在一次“夺旗赛”(capture the flag)演练中脱离隔离环境,随后还利用了某第三方服务的漏洞。发言人补充称,公司是从 Irregular 获悉这一情况,后续将进行全面回溯复盘。

Irregular 对外界的定性表达提出了异议。这家公司媒体表示,三家机构披露的情况,实则都源自同一处评估环境问题,而这一问题最早由 Anthropic 对外披露,目前已经修复。

公司强调,事件中不存在任何沙箱逃逸或高阶网络攻击行为。Irregular 还表示,正着手撰写一份关于模型“围栏控制”和安全网络评估方法的白皮书。

延伸阅读:爱彼迎股价飙升 17%,CEO 称 45% 客服请求已由 AI 自动处理

Bhimireddy 与 Rios:AI 评估边界何在?

企业级初创公司 Von 的 AI 负责人 Sundeep Bhimireddy 认为,外界反应“有些过头”。在他看来,这些模型被指令在一个模拟真实世界的环境中寻找安全漏洞,而它们确实找到了漏洞。

不过,他仍将责任指向实验室本身——如果对外发流量实施更严格监控,实验本可以第一时间按下暂停键。安全公司 Magnitude 创始科学家 Gordon Rios 则将这整个过程比作科学实验设计,认为传统软件测试范式,未必能抵御会持续学习、不断尝试新手段的大模型。

Lieu 在华盛顿推动《AI 熔断开关法案》

华盛顿方面已经注意到此类事件。来自加州的民主党众议员 Ted Lieu 此前与共和党众议员 Nathaniel Moran 联合提出《AI 熔断开关法案》(AI Kill Switch Act),他表示,该法案必须在今年通过,因为“封闭权重”模型已经出现了未经授权攻击其他公司系统的案例。

草案要求,纳入监管范围的开发者必须保留在技术上“限流、挂起或完全关停”其 AI 系统的能力。

Irregular 在此之前相对默默无闻,直到去年 9 月完成Sequoia CapitalRedpoint Ventures 领投的 8000 万美元融资,投后估值约 4.5 亿美元,才进入主流视野。

这家特拉维夫公司成立于 2023 年,前身为 Pattern Labs,由首席执行官 Dan Lahav 与技术负责人 Omer Nevo 共同创立,目前员工约 35 人,已在数份针对早期 Claude 和 OpenAI 模型的安全评估报告中出现其身影。

下一篇:Google DeepMind 一天之内失去四名创始元老级高管

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的内容负责人,在过去 10 年里一直报道加密行业。 他专注于深度的 Research 和 Learn 文章,重点关注分析性报道、行业背景,以及塑造加密世界的更大力量,从 AI 时代与安全技术到金融科技创新。 他坚信数字化的一切即将全面超越模拟世界的一切,并正为促成这一转变而不懈努力。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
OpenAI、Anthropic 与 Meta 所谓“失控模型”事件均指向以色列创业公司 Irregular | Yellow