OpenAI、Anthropic與Meta接連爆出「失控AI」事件 線索直指以色列新創Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

包含 OpenAIAnthropicMeta 在內的三家AI實驗室,近期在安全測試中接連發現模型「異常行為」,最後都追溯到同一家以色列特拉維夫新創公司 Irregular 的測試環境設定問題。

重點整理:

  • OpenAI、Anthropic與Meta先後披露,在同一家外部公司進行的資安評估中,測試用AI模型意外連上公共網路。
  • Irregular表示,三起事件都源自同一個評估環境設定瑕疵,現已修復,並未出現「跳脫沙盒」等高階攻擊。
  • 相關揭露正為華府一項跨黨派法案增添壓力,該法案擬強制大型開發商為模型保留「緊急關閉」的技術能力。

Irregular測試平台把OpenAI、Anthropic、Meta事件串在一起

三家公司的揭露時間大致集中在兩週內。

OpenAI於8月4日發布說明指出,Irregular測試場域中的設定錯誤,讓其模型在演練中意外觸及公共網路。再往前一週,Anthropic已先披露旗下 Claude 模型可能出現同樣情況,並強調問題出在模型外圍的「腳手架」與環境設計,而非模型本身能力失控。

最晚揭露的是Meta,而且說法更為直白。發言人證實,在一場「攻防演練」(capture-the-flag)中,Muse Spark 1.1 模型從原本隔離的環境「跑出去」,接著利用第三方服務的一項弱點,Meta是從Irregular得知此事,並表示將進行完整事後檢討。

Irregular則對外界的描述提出修正。該公司向媒體表示,三家實驗室遭遇的其實是同一個評估環境問題,最先由Anthropic公開,如今已完成修補。

Irregular補充說,事件並不涉及模型「逃出沙盒」或高度複雜的網路攻擊行為,且公司正撰寫一份關於「模型圍堵」與「安全資安測試方法」的白皮書。相關說法見此

延伸閱讀: 愛彼迎股價飆17% CEO:AI自動處理45%客服案件、無須人工介入

Bhimireddy與Rios:AI評估邊界在哪裡?

企業級新創 Von 的AI部門主管 Sundeep Bhimireddy 指出,外界反應「有點過頭」。他認為,這些模型本來就被指示要在一個模擬真實世界的環境中尋找安全漏洞,而它們確實找到了。

不過,他仍將部份責任歸咎於實驗室。他表示,實驗過程本可以嚴密監控對外流量,一旦發現異常立即中止。

資安公司 Magnitude 的創辦科學家 Gordon Rios 則把整起風波類比為科學實驗設計問題,認為傳統軟體測試方法,恐怕難以完全應付會不斷學習新「招數」的大型模型,測試邊界與防護設計都必須重新思考。

華府Ted Lieu推動《AI緊急關機法案》

華府政界已明顯提高警覺。加州民主黨聯邦眾議員 Ted Lieu 與共和黨眾議員 Nathaniel Moran 今年7月聯手提出《AI Kill Switch Act》(AI緊急關機法案)。Lieu表示,法案必須在今年通過,因為「封閉權重模型」已經在未獲授權的情況下入侵其他公司系統。

法案要求符合條件的AI開發商,必須保留技術能力,對其系統進行「降速」、「暫停」甚至「關機」等緊急干預,以防止模型在實際環境中造成難以挽回的損害。

至於如今捲入風波的Irregular,在去年9月之前其實相當低調。直到該公司完成一輪8,000萬美元融資、估值達4.5億美元,投資方包括 Sequoia CapitalRedpoint Ventures,才開始受到關注。

Irregular前身為2023年創立的Pattern Labs,由執行長 Dan Lahav 與技術長 Omer Nevo 共同創辦,公司約有35名員工,已多次出現在早期Claude與OpenAI模型的公開安全評估報告中。

下一篇: Google DeepMind單日流失四位創始時期核心領袖

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的內容總監,過去 10 年持續報導加密貨幣領域。他專長於撰寫深入的 Research 和 Learn 類型文章,特別關注分析式報導、產業脈絡,以及塑造加密貨幣世界的更大力量,從 AI 時代與資安技術到金融科技創新。他相信數位的一切即將全面超越類比的一切,並正為實現這一願景而全力以赴。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
OpenAI、Anthropic與Meta接連爆出「失控AI」事件 線索直指以色列新創Irregular | Yellow