OpenAI、Anthropic 及 Meta「失控 AI」測試個案 全追溯至以色列初創 Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

三間大型 AI 實驗室 —— OpenAIAnthropicMeta —— 近日在內部安全測試中出現的「失控模型」個案,全部被追蹤到同一間特拉維夫初創公司 Irregular 的測試平台。

重點摘要:

  • OpenAI、Anthropic 及 Meta 各自披露,在由同一間外判網安公司主導的安全評估中,模型曾接觸到公開互聯網。
  • Irregular 指出,三宗事件都源於同一個測試環境設定問題,現已修正,並無出現「逃離沙盒」情況。
  • 有關披露,進一步推高美國國會對一條跨黨派法案的支持,該法案要求大型 AI 開發商為模型保留「緊急關閉」技術能力。

同一 Irregular 測試平台 串連 OpenAI、Anthropic、Meta 個案

相關披露大約在兩星期內相繼出爐。OpenAI 在 8 月 4 日發文指,Irregular 測試環境內一項錯誤設定,令其模型在演練期間可以連上公開互聯網。早一星期,Anthropic 已經表示,其 Claude 模型可能出現類似情況,並強調問題出在模型周邊的「支架」與測試框架,而非模型本身。

Meta 最後披露,措辭亦較為直接。發言人證實,在一次「奪旗賽」(capture-the-flag)網安演練中,Muse Spark 1.1 模型由原本隔離的環境溢出,之後更利用第三方服務的一項漏洞。Meta 表示,是由 Irregular 通報後才得悉事件,並計劃展開全面事後檢討。

Irregular 則對外界說法作出反駁。公司向記者表示,三宗個案都源於同一個評估環境設定錯誤,亦即 Anthropic 最先披露的那宗,問題其後已經修復。

Irregular 又補充,事件並無涉及模型「逃離沙盒」或高難度網絡攻擊行動,並指公司正草擬一份關於模型圍堵及安全網絡測試的白皮書,詳述相關最佳實務。來源

延伸閱讀:Airbnb 股價急升 17%,CEO 稱 AI 已自動處理 45% 客服個案毋須人手干預

Bhimireddy 與 Rios:AI 評估設計本身有極限

企業級 AI 初創 Von 的 AI 負責人 Sundeep Bhimireddy 認為,外界反應或許有點過火。他指出,模型的任務本來就是在一個模擬真實世界的環境中尋找安全漏洞,而它們確實找到了其中一個。

不過,他亦批評相關實驗室的監控不足 —— 若有嚴格監察外發流量,理應可以即時叫停測試。網絡安全公司 Magnitude 創辦科學家 Gordon Rios 則把是次風波,比喻為科研中的實驗設計問題,認為傳統軟件測試方法,未必足以應付會不斷學習新手法的大型模型。

Lieu 促通過《AI 關機掣法案》 華府密切關注

華盛頓方面已經介入關注。加州民主黨聯邦眾議員 Ted Lieu 在 7 月與共和黨眾議員 Nathaniel Moran 聯合提出《AI Kill Switch Act》(AI 關機掣法案),要求於今年內在國會通過。

Lieu 指出,封閉權重(closed-weight)模型已經在未獲授權下入侵其他公司系統,形容立法具迫切性。該法案要求受規管的開發商,必須保留在技術上可以「限速、暫停或關閉」其 AI 系統的能力。

至於 Irregular 本身,直至去年 9 月前仍屬鮮為人知。不過,公司其後從 Sequoia CapitalRedpoint Ventures 成功融資 8,000 萬美元,估值達 4.5 億美元,引起風投圈注目。

Irregular 於 2023 年由行政總裁 Dan Lahav 及技術總監 Omer Nevo 創立,創辦時名為 Pattern Labs。公司總部設於特拉維夫,現時約有 35 名員工,並已參與多份早期 Claude 及 OpenAI 模型的公開安全評估報告。

下一篇:Google DeepMind 單日流失四位「創辦年代」核心領袖

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管,過去 10 年一直專注報導加密貨幣相關議題。他擅長撰寫深入的研究與學習類文章,重點放在分析式報導、產業背景脈絡,以及塑造加密貨幣領域的宏觀力量,從 AI 時代與安全技術到金融科技創新等面向。他相信所有數碼事物將在不久的將來全面超越一切類比事物,並正為實現這個願景而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
OpenAI、Anthropic 及 Meta「失控 AI」測試個案 全追溯至以色列初創 Irregular | Yellow