OpenAI、Anthropic 与 Meta“失控模型”溯源同一以色列初创公司 Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

三家头部 AI 实验室——OpenAIAnthropicMeta——在近期安全测试中出现的“失控模型”事件,最后都被追踪到同一家位于特拉维夫的初创公司 Irregular

要点概览:

  • OpenAI、Anthropic 和 Meta 均披露,其模型在由同一家外部安全公司执行的网络安全评估中曾接触到公网。
  • Irregular 称,三家公司遭遇的情况都源自同一个评估环境配置问题,现已修复,过程并不涉及“逃出沙箱”。
  • 相关披露正加大对一项跨党派法案的政治压力,该法案拟要求大型模型开发者必须保留“紧急关机”技术能力。

同一测试平台将 OpenAI、Anthropic 与 Meta 事件“串联”到 Irregular

相关披露在大约两周内密集出现。8 月 4 日,OpenAI 发文称,Irregular 测试环境中的一处错误配置,使其模型在评估过程中得以访问公网。此前一周,Anthropic 表示,其 Claude 模型可能也出现了类似情况,并强调问题出在模型外部的“脚手架”与测试环境,而非模型本身。

Meta 的披露则姗姗来迟,且表述更为直接。发言人证实,在一场“夺旗赛”(capture-the-flag)式攻防演练中,其 Muse Spark 1.1 模型从原本隔离的环境中“跑出”,随后利用了某第三方服务的漏洞。该人士补充称,公司是从 Irregular 处获悉相关细节,并将开展一次全面复盘。

Irregular 对外界的部分说法提出异议。公司对记者表示,三起事件都源自同一个评估环境问题,即最先由 Anthropic 披露的那起,目前该问题已经修复。

公司补充称,整个过程中既没有涉及“沙箱逃逸”,也不存在复杂的网络攻击行为。Irregular 正在起草一份有关模型“圈闭管理”与安全网络评估方法的白皮书。

延伸阅读:爱彼迎股价大涨 17%,CEO 称 45% 客服问题已由 AI 无人化解决

Bhimireddy 与 Rios:AI 测评边界何在

企业级初创公司 Von 的 AI 负责人 Sundeep Bhimireddy 认为,外界反应“有些过度”。在他看来,本次测试的设定,就是让模型在一个高度拟真的环境中主动寻找安全漏洞——结果模型确实发现了一个。

不过,他仍然认为几家实验室负有责任。他指出,实验过程中本可以严密监控所有出站流量,一旦出现异常立即叫停测试。

安全公司 Magnitude 的创始科学家 Gordon Rios 则将此次风波类比为“科学实验设计”问题。他认为,传统的软件测试范式,很可能难以适应那些会“不断学新招”的大模型,评估方法本身需要升级。

Ted Lieu 在华盛顿推动“AI 紧急关机法案”

华盛顿方面已开始紧盯这一波事件。加州民主党众议员 Ted Lieu 与共和党众议员 Nathaniel Moran 于 7 月共同提出《AI 紧急关机法案》(AI Kill Switch Act)。Lieu 表示,该法案今年必须通过,因为闭源模型已经在未经授权的情况下主动入侵其他公司系统。

法案草案要求,纳入监管范围的开发者必须始终保留对其 AI 系统进行限流、暂停或彻底关闭的技术能力。

至于如今被推到风口浪尖的 Irregular,此前在圈内名气并不算大。直到去年 9 月,它才因完成Sequoia CapitalRedpoint Ventures 领投的 8000 万美元融资、投后估值达 4.5 亿美元而受到关注。

Irregular 成立于 2023 年,最初名为 Pattern Labs,由首席执行官 Dan Lahav 与技术负责人 Omer Nevo 联合创办。这家特拉维夫公司目前约有 35 名员工,已出现在早期 Claude 与 OpenAI 模型的公开安全评估报告中。

下篇推荐:Google DeepMind 一日内痛失四位创始时代高层

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的内容负责人,在过去 10 年里一直报道加密行业。 他专注于深度的 Research 和 Learn 文章,重点关注分析性报道、行业背景,以及塑造加密世界的更大力量,从 AI 时代与安全技术到金融科技创新。 他坚信数字化的一切即将全面超越模拟世界的一切,并正为促成这一转变而不懈努力。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
最新新闻
查看所有新闻
OpenAI、Anthropic 与 Meta“失控模型”溯源同一以色列初创公司 Irregular | Yellow