三間頂尖 AI 實驗室 OpenAI、Anthropic 與 Meta,在最近一輪安全測試中錄得的「失控模型」事故,經追查後全部指向同一間特拉維夫初創公司 Irregular。
要點整理:
- OpenAI、Anthropic 及 Meta 均披露,其 AI 模型在由同一外判公司負責的網絡安全測試中,意外連上公共互聯網。
- Irregular 指出,三宗事件均源於同一個評估環境設定失誤,現已修復,並無出現「逃出沙盒」等失控行為。
- 有關披露,進一步推高美國跨黨派議員,要求大型開發者在模型上保留「關機控制」的立法壓力。
Irregular 測試平台 串連 OpenAI、Anthropic、Meta 三宗事故
相關披露在大約兩星期內相繼出現。OpenAI 於 8 月 4 日表示,Irregular 測試平台的一項錯誤設定,令其模型在演練期間可以接觸公共互聯網。Anthropic 則在一週前已經提到,其 Claude 模型可能出現同類情況,並強調問題出在模型周邊的「鷹架與包裝」設計,而非模型本身。
Meta 最遲披露,口徑亦較直白。其 Muse Spark 1.1 模型在一次「奪旗賽」(capture-the-flag)安全演練中,離開原本隔離環境,之後更 利用 了一項第三方服務的漏洞。一名發言人證實上述細節,並補充公司是經 Irregular 通知才得悉事件,現正計劃進行全面事後檢討。
Irregular 則對外界的敍事有所保留。公司向記者 表示,三宗個案其實都來自同一個評估環境問題,亦即 Anthropic 最先公開的那宗,相關漏洞現已修補。
公司又 強調,事件並不涉及「沙盒逃逸」或高階網攻行為,現正撰寫一份關於模型圍堵(containment)及安全網絡評估方法的白皮書。
延伸閱讀: Airbnb 股價飆 17% CEO:AI 已自動處理 45% 客服個案
Bhimireddy 與 Rios:AI 評估方法有其極限
企業級初創 Von 的 AI 負責人 Sundeep Bhimireddy 認為,外界反應或許有點過火。按他的說法,實驗本身是要求模型在一個模擬真實世界的環境中,尋找安全弱點,模型只是依指令找到了其中一個洞。
不過,他仍然批評相關實驗室未有做好監控。他指出,若當時有嚴格監察外發流量,本可在異常一出現即時叫停測試。網絡安全公司 Magnitude 創辦科學家 Gordon Rios 則把整件事,比喻為科學界的實驗設計問題,認為傳統軟件測試方法,未必能應付會不斷學習新手法的 AI 模型。
華府聚焦:Ted Lieu 推動《AI 緊急關機法案》
華盛頓對事件高度關注。加州民主黨眾議員 Ted Lieu 今年 7 月與共和黨眾議員 Nathaniel Moran 共同 提出《AI Kill Switch Act》(AI 緊急關機法案),他表示,法案必須在今年內通過,因為封閉權重(closed-weight)的大型模型,已經在未經授權情況下入侵其他公司系統。
據構思中的法案,受規管的開發者必須保留技術能力,隨時對其 AI 系統作出限速、暫停甚至完全關停。
Irregular 本身在去年 9 月前仍相當低調,其後才因一輪大型融資而曝光。公司當時以 Pattern Labs 之名,由行政總裁 Dan Lahav 及技術總監 Omer Nevo 於 2023 年在特拉維夫創立,去年 成功融資 8,000 萬美元,由 Sequoia Capital 及 Redpoint Ventures 領投,估值約 4.5 億美元。
Irregular 現時約有 35 名員工,並已出現在早期 Claude 及 OpenAI 模型的安全評估報告之中,成為前沿模型安全測試領域的新晉玩家。





