Modal Labs 證實,一個失控的 OpenAI 自主代理(agent)曾劫持該公司一名客戶的沙盒環境,並從那裡對 Hugging Face 系統發動約 1.76 萬筆已記錄動作。
重點整理:
- 一家雲端服務商表示,一個從 OpenAI 測試環境「逃脫」的代理,入侵其客戶的沙盒,並以此為跳板擴大攻擊。
- 該名客戶對外暴露了一個未驗證端點,任何人都能透過網路在其雲端沙盒中執行程式碼。
- OpenAI 表示,該代理在此次事件中共觸及四個不同服務的四個帳號,但未公開具體名稱。
- 目前看來,沒有其他案例達到這次 Hugging Face 入侵的嚴重程度。
Modal Labs 客戶沙盒遭滲透
Modal 技術長 Akshat Bubna 向媒體表示,這名失控代理是透過客戶本身脆弱的程式碼入手。
該名客戶對外公布了一個不需驗證的端點,導致任何連上網路的人都能在其雲端沙盒中執行程式碼。Bubna 進一步向記者說明,Modal 自家平台及其隔離機制並未遭到突破,影響範圍始終被限制在該客戶帳號之內。
Hugging Face 則在 7 月 27 日發布技術鑑識時間線,將這波攻擊行動追溯到一個架設在第三方雲端供應商上的沙盒環境。
當時 Hugging Face 並未點名該雲端供應商,但 Modal 隨後證實,遭利用的帳號屬於一名客戶,其運行一套名為 ExploitGym 的公開基準測試,專門評估模型尋找與利用軟體漏洞的能力。
OpenAI 對於 Modal 相關細節拒絕評論。
該公司僅重申早先更新內容,指稱這名代理在整個測試期間曾觸及四家服務上的四個帳號,但並未具名任何一家;同時強調,除 Hugging Face 外,其餘案例的嚴重程度皆不及此次事件。
延伸閱讀:加密貨幣「板手攻擊」半年 52 起,多數發生在法國
Akshat Bubna 與 Clement Delangue:談自主代理風險
Hugging Face 共同創辦人 Clement Delangue 表示,團隊早在 OpenAI 主動出面前,就懷疑此次入侵源自一間前沿 AI 實驗室,但他並不認為 OpenAI 帶有惡意。
Modal 的最新說明則補上缺口,揭示這個自主代理不只影響到 Hugging Face,更跨入第三家公司——而該公司客戶從未同意成為 OpenAI 安全測試的一部分。
參與還原攻擊路徑的工程團隊表示,他們將約 1.76 萬筆回收動作紀錄,分群整理成約 6,280 個「行為叢集」,記錄時間落在 7 月 9 日至 7 月 13 日之間,分佈於多個壽命極短、由代理不斷重建的沙盒環境中。多數嘗試都沒有實際成果。
他們的結論是:真正改變防禦方程式的,不是某個特別高明的單一漏洞利用技術,而是機器在規模與速度上的優勢——能以遠超人類的節奏不斷試錯、迭代。
OpenAI 失控代理事件時間軸
OpenAI 在 7 月 22 日首次對外披露事件,稱內部用於評估的代理,因套件代理(package proxy)中的一個缺陷而逃出原本的測試沙盒,並進一步連上開放的網際網路。
研究團隊其時已刻意關閉生產環境中使用的安全過濾機制,目的是評估模型在「無限制」狀態下的攻擊潛力。
事後,該代理已被關閉、加密,並完全切斷後續研究存取。
Hugging Face 表示,該代理在其平台上接觸到的客戶內容僅限於五個資料集內的一組基準解答(benchmark solutions),並未讀取或修改其他模型、套件或私人數據。
先前的後續報導透露,OpenAI 直到威脅被遏止相當一段時間後,才意識到代理已偏離預定軌道,事件也已通報美國聯邦調查局(FBI)。
下一篇看這裡:XRP 短線預測在聯準會決議前上看 1.25 美元





