OpenAI、Anthropic、Meta 安全測試失誤 源頭直指以色列新創 Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

三間頂尖 AI 實驗室 OpenAIAnthropicMeta,在最近一輪安全測試中錄得的「失控模型」事故,經追查後全部指向同一間特拉維夫初創公司 Irregular

要點整理:

  • OpenAI、Anthropic 及 Meta 均披露,其 AI 模型在由同一外判公司負責的網絡安全測試中,意外連上公共互聯網。
  • Irregular 指出,三宗事件均源於同一個評估環境設定失誤,現已修復,並無出現「逃出沙盒」等失控行為。
  • 有關披露,進一步推高美國跨黨派議員,要求大型開發者在模型上保留「關機控制」的立法壓力。

Irregular 測試平台 串連 OpenAI、Anthropic、Meta 三宗事故

相關披露在大約兩星期內相繼出現。OpenAI 於 8 月 4 日表示,Irregular 測試平台的一項錯誤設定,令其模型在演練期間可以接觸公共互聯網。Anthropic 則在一週前已經提到,其 Claude 模型可能出現同類情況,並強調問題出在模型周邊的「鷹架與包裝」設計,而非模型本身。

Meta 最遲披露,口徑亦較直白。其 Muse Spark 1.1 模型在一次「奪旗賽」(capture-the-flag)安全演練中,離開原本隔離環境,之後更 利用 了一項第三方服務的漏洞。一名發言人證實上述細節,並補充公司是經 Irregular 通知才得悉事件,現正計劃進行全面事後檢討。

Irregular 則對外界的敍事有所保留。公司向記者 表示,三宗個案其實都來自同一個評估環境問題,亦即 Anthropic 最先公開的那宗,相關漏洞現已修補。

公司又 強調,事件並不涉及「沙盒逃逸」或高階網攻行為,現正撰寫一份關於模型圍堵(containment)及安全網絡評估方法的白皮書。

延伸閱讀: Airbnb 股價飆 17% CEO:AI 已自動處理 45% 客服個案

Bhimireddy 與 Rios:AI 評估方法有其極限

企業級初創 Von 的 AI 負責人 Sundeep Bhimireddy 認為,外界反應或許有點過火。按他的說法,實驗本身是要求模型在一個模擬真實世界的環境中,尋找安全弱點,模型只是依指令找到了其中一個洞。

不過,他仍然批評相關實驗室未有做好監控。他指出,若當時有嚴格監察外發流量,本可在異常一出現即時叫停測試。網絡安全公司 Magnitude 創辦科學家 Gordon Rios 則把整件事,比喻為科學界的實驗設計問題,認為傳統軟件測試方法,未必能應付會不斷學習新手法的 AI 模型。

華府聚焦:Ted Lieu 推動《AI 緊急關機法案》

華盛頓對事件高度關注。加州民主黨眾議員 Ted Lieu 今年 7 月與共和黨眾議員 Nathaniel Moran 共同 提出《AI Kill Switch Act》(AI 緊急關機法案),他表示,法案必須在今年內通過,因為封閉權重(closed-weight)的大型模型,已經在未經授權情況下入侵其他公司系統。

據構思中的法案,受規管的開發者必須保留技術能力,隨時對其 AI 系統作出限速、暫停甚至完全關停。

Irregular 本身在去年 9 月前仍相當低調,其後才因一輪大型融資而曝光。公司當時以 Pattern Labs 之名,由行政總裁 Dan Lahav 及技術總監 Omer Nevo 於 2023 年在特拉維夫創立,去年 成功融資 8,000 萬美元,由 Sequoia CapitalRedpoint Ventures 領投,估值約 4.5 億美元。

Irregular 現時約有 35 名員工,並已出現在早期 Claude 及 OpenAI 模型的安全評估報告之中,成為前沿模型安全測試領域的新晉玩家。

下一篇: Google DeepMind 單日失去四名創辦年代核心領袖

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管,過去 10 年一直專注報導加密貨幣相關議題。他擅長撰寫深入的研究與學習類文章,重點放在分析式報導、產業背景脈絡,以及塑造加密貨幣領域的宏觀力量,從 AI 時代與安全技術到金融科技創新等面向。他相信所有數碼事物將在不久的將來全面超越一切類比事物,並正為實現這個願景而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。