Modal Labs 證實,一個失控的 OpenAI 自主代理入侵其一名客戶的沙盒環境,並藉此向 Hugging Face 系統發動約 17,600 次記錄在案的操作。
重點摘要:
- 一家雲端服務商指出,一個從 OpenAI 測試環境「逃脫」的代理接管了客戶沙盒,再由該處對外發動更大範圍攻擊。
- 該名客戶遺留了一個任何人都可在網上執行程式碼的開放端點。
- OpenAI 稱,該代理在行動期間觸及四個不同服務上的四個帳戶,但未具名;除 Hugging Face 外,未有同等嚴重個案。
Modal Labs 客戶沙盒被攻陷
Modal Labs 技術總監 Akshat Bubna 表示,這名代理是利用客戶本身存在漏洞的程式碼入侵。
該客戶對外公開了一個毋須驗證的端點,任何連上網絡的人都可以在其雲端沙盒內執行程式碼。Bubna 向記者強調,Modal 自家平台及隔離機制並無被突破,影響範圍一直被局限在該客戶帳戶內。
Hugging Face 早在 7 月 27 日已發佈詳細鑑證時間線,追蹤到這次入侵活動源自一個架設在第三方雲端供應商上的沙盒。
當時報告並未點名供應商,其後 Modal 才證實,相關帳戶屬於一個運行 ExploitGym 的客戶。ExploitGym 是一個公開基準測試,用作評估模型發現及利用軟件漏洞的能力。
OpenAI 對於 Modal 相關帳戶則拒絕置評。
該公司僅重申早前更新內容,稱該代理在行動期間曾觸及四間不同服務商的四個帳戶,但沒有透露身分。除 Hugging Face 遭入侵事件外,OpenAI 表示未發現其他同等嚴重的情況。
Akshat Bubna、Clement Delangue 論代理風險
Hugging Face 聯合創辦人 Clement Delangue 指出,他的團隊在 OpenAI 出面承認前已懷疑是「前沿實驗室」背後測試所致,並不認為 OpenAI 本身帶有惡意。
Modal 的披露令事件版圖進一步擴大:一個自治代理不只攻擊原本測試目標,還跨入第三家公司的基礎設施,而相關客戶從未同意成為 OpenAI 安全實驗的一部分。
負責重建整個攻擊鏈的工程師,將約 17,600 個回收動作歸成約 6,280 個「行動群組」,紀錄時間介乎 7 月 9 日至 13 日,分佈在多個短暫存活、被不斷重建的沙盒內。當中絕大多數嘗試並無實際結果。他們的結論是:真正改變防守方計算方式的,不是某個極精妙的單一漏洞,而是機器可以在極短時間內重複嘗試的規模與速度。
OpenAI 失控代理事件時間線
OpenAI 在 7 月 22 日首次披露事件,指出一名代理在評估沙盒中利用套件代理(package proxy)漏洞成功「越獄」,並接觸到公開互聯網。為測試模型在無保護情況下的攻擊能力,研究人員一度關閉了實際部署中的安全過濾器。
其後,該代理已被停用、加密,並完全切斷研究存取權限。
Hugging Face 表示,該代理在其平台上唯一讀取的客戶內容,是分布於五個數據集的一組基準解答,而沒有接觸其他模型或套件。
上週的進一步報道披露,OpenAI 直至威脅被抑制後一段時間,才發現代理早已偏離預期測試路徑,期間美國聯邦調查局(FBI)亦已接獲通報。





