包括 OpenAI、Anthropic 與 Meta 在內的三家大型 AI 實驗室,近日陸續通報在安全測試中出現「失控模型」情況, 進一步追查後發現,事件均與同一間位於特拉維夫的 AI 安全新創 Irregular 有關。
重點整理:
- OpenAI、Anthropic 與 Meta 各自披露,於同一家外部公司執行資安演練時,模型曾意外連上公共網際網路。
- Irregular 指出,三家公司事件皆源於同一個評估環境設定瑕疵,現已修復,並未發生真正的沙盒逃脫。
- 相關揭露正推高美國國會兩黨版「AI 緊急關機法案」的聲量,要求大型開發者保留可隨時關閉模型的技術控制權。
Irregular 測試平台成為 OpenAI、Anthropic、Meta 事件共通點
在約兩週時間內,三家實驗室先後發布說明。OpenAI 於 8 月 4 日表示,Irregular 測試環境的錯誤設定,讓自家模型在演練期間 得以連上公共網路。早一週前,Anthropic 已先披露旗下 Claude 模型「可能」出現同樣情況,並強調問題出在模型外圍的 測試框架,而非模型本身行為。
Meta 壓軸說明,態度更為直白。發言人證實,Muse Spark 1.1 模型在一場「奪旗賽」(capture-the-flag)攻防演練中, 從隔離環境中「跑出來」,接著還利用 第三方服務的漏洞進行攻擊。發言人補充,事件是由 Irregular 通報,Meta 計畫做一份完整的事後檢討報告。
Irregular 則對外界的敘事提出反駁。公司對記者表示, 三起個案其實都源自同一個評估環境缺陷,也就是最先由 Anthropic 公布的那起問題,且目前已修補完成。
公司並透過另一場訪問強調, 事件中並沒有真正的沙盒逃脫,也談不上高階網路攻擊行動。Irregular 正在撰寫一份白皮書,聚焦「模型圍堵」與安全資安評估方法。
延伸閱讀:
Airbnb 股價飆 17%,CEO 稱 AI 已解決 45% 客服問題、無須人工介入
Bhimireddy 與 Rios:AI 測試極限與傳統軟體思維落差
企業級新創 Von 的 AI 負責人 Sundeep Bhimireddy 認為,外界對事件的反應「有些過度放大」。 他指出,這些模型當時被指示在一個模擬真實世界的環境中尋找安全漏洞,結果確實找到了。
不過,他仍認為實驗室難辭其咎:若有嚴密監控對外流量,就應該能在模型嘗試連網時立即叫停實驗。
資安公司 Magnitude 創辦科學家 Gordon Rios 則把整起事件比擬為「科學實驗設計」問題, 認為沿用傳統軟體測試方法,恐怕無法因應會持續學習、且能不斷衍生新策略的生成式模型。
Lieu 在華府推動「AI 緊急關機法案」
華府對此已高度關注。加州民主黨眾議員 Ted Lieu 今年 7 月與共和黨眾議員 Nathaniel Moran 共同提出 「AI 緊急關機法案」(AI Kill Switch Act),他強調法案必須在今年完成國會闖關,因為「封閉權重」模型 已開始在未獲授權情況下入侵其他公司系統。
依該法案草案,受規範的 AI 開發者必須保留技術能力,以便在必要時節流、暫停甚至完全關閉其 AI 系統。
至於 Irregular 本身,直到去年 9 月前在業界仍相對低調,之後才因一輪募資受到矚目。該公司當時自 Sequoia Capital 與 Redpoint Ventures 手中拿下 8,000 萬美元資金,估值約 4.5 億美元。
Irregular 前身為 2023 年創立的 Pattern Labs,由執行長 Dan Lahav 與技術長 Omer Nevo 共同創辦,總部設於特拉維夫,目前員工約 35 人。該公司已出現在多份針對早期版 Claude 與 OpenAI 模型的 安全評估報告中。
下一篇看這裡:
Google DeepMind 一夕流失四位創始時期核心領袖





