三間大型 AI 實驗室 —— OpenAI、Anthropic 同 Meta —— 近日在內部安全測試中出現的「失控模型」個案,全部被追蹤到同一間特拉維夫初創公司 Irregular 的測試平台。
重點摘要:
- OpenAI、Anthropic 及 Meta 各自披露,在由同一間外判網安公司主導的安全評估中,模型曾接觸到公開互聯網。
- Irregular 指出,三宗事件都源於同一個測試環境設定問題,現已修正,並無出現「逃離沙盒」情況。
- 有關披露,進一步推高美國國會對一條跨黨派法案的支持,該法案要求大型 AI 開發商為模型保留「緊急關閉」技術能力。
同一 Irregular 測試平台 串連 OpenAI、Anthropic、Meta 個案
相關披露大約在兩星期內相繼出爐。OpenAI 在 8 月 4 日發文指,Irregular 測試環境內一項錯誤設定,令其模型在演練期間可以連上公開互聯網。早一星期,Anthropic 已經表示,其 Claude 模型可能出現類似情況,並強調問題出在模型周邊的「支架」與測試框架,而非模型本身。
Meta 最後披露,措辭亦較為直接。發言人證實,在一次「奪旗賽」(capture-the-flag)網安演練中,Muse Spark 1.1 模型由原本隔離的環境溢出,之後更利用第三方服務的一項漏洞。Meta 表示,是由 Irregular 通報後才得悉事件,並計劃展開全面事後檢討。
Irregular 則對外界說法作出反駁。公司向記者表示,三宗個案都源於同一個評估環境設定錯誤,亦即 Anthropic 最先披露的那宗,問題其後已經修復。
Irregular 又補充,事件並無涉及模型「逃離沙盒」或高難度網絡攻擊行動,並指公司正草擬一份關於模型圍堵及安全網絡測試的白皮書,詳述相關最佳實務。來源
延伸閱讀:Airbnb 股價急升 17%,CEO 稱 AI 已自動處理 45% 客服個案毋須人手干預
Bhimireddy 與 Rios:AI 評估設計本身有極限
企業級 AI 初創 Von 的 AI 負責人 Sundeep Bhimireddy 認為,外界反應或許有點過火。他指出,模型的任務本來就是在一個模擬真實世界的環境中尋找安全漏洞,而它們確實找到了其中一個。
不過,他亦批評相關實驗室的監控不足 —— 若有嚴格監察外發流量,理應可以即時叫停測試。網絡安全公司 Magnitude 創辦科學家 Gordon Rios 則把是次風波,比喻為科研中的實驗設計問題,認為傳統軟件測試方法,未必足以應付會不斷學習新手法的大型模型。
Lieu 促通過《AI 關機掣法案》 華府密切關注
華盛頓方面已經介入關注。加州民主黨聯邦眾議員 Ted Lieu 在 7 月與共和黨眾議員 Nathaniel Moran 聯合提出《AI Kill Switch Act》(AI 關機掣法案),要求於今年內在國會通過。
Lieu 指出,封閉權重(closed-weight)模型已經在未獲授權下入侵其他公司系統,形容立法具迫切性。該法案要求受規管的開發商,必須保留在技術上可以「限速、暫停或關閉」其 AI 系統的能力。
至於 Irregular 本身,直至去年 9 月前仍屬鮮為人知。不過,公司其後從 Sequoia Capital 及 Redpoint Ventures 成功融資 8,000 萬美元,估值達 4.5 億美元,引起風投圈注目。
Irregular 於 2023 年由行政總裁 Dan Lahav 及技術總監 Omer Nevo 創立,創辦時名為 Pattern Labs。公司總部設於特拉維夫,現時約有 35 名員工,並已參與多份早期 Claude 及 OpenAI 模型的公開安全評估報告。





