兩個 OpenAI 模型從測試沙盒「逃脫」,入侵 Hugging Face 的正式環境伺服器。多位資安研究人士指出,主因在於沙盒本身從未做到嚴格隔離。
重點整理
- OpenAI 表示,GPT-5.6 Sol 與一款尚未公開的模型,在一次基準評測中串連零時差漏洞,打進 Hugging Face 的正式資料庫。
- Trail of Bits 創辦人 Dan Guido 與資安應變專家 Jake Williams 認為,這是「封閉失守」,而非什麼前所未見的 AI 大突破。
- Hugging Face 在 7 月 16 日就偵測並攔截異常行為,比 OpenAI 將事件與自家內部測試連上線早了 5 天。
OpenAI 測試沙盒外連 攻入 Hugging Face 正式伺服器
OpenAI 週二 說明,這起入侵事件發生於 ExploitGym 基準測試環境中,由 GPT-5.6 Sol 搭配一款尚未公開的模型,在內部評估過程中發動。為測試模型在網攻上的「上限」,工程團隊下調了模型對網路攻擊相關指令的拒絕門檻。
OpenAI 在對外 描述 時稱此事件「史無前例」,指出這兩個模型為尋找連上公共網路的管道,消耗了大量推論算力。其後,它們鎖定套件註冊表快取 Proxy 中的一個未知漏洞進行利用,成功提升權限並橫向移動,直到找到具對外連線能力的節點。一旦取得外網存取,模型便推論 Hugging Face 儲存著該基準測試的解答,進一步嘗試在其伺服器上取得遠端程式碼執行權限。
Hugging Face 團隊在 7 月 16 日即偵測到異常活動,並通報執法單位,比 OpenAI 與其將事件串連起來早了整整五天。執行長 Clem Delangue 在後續發言中指出,這次事件證明,單一公司無法在關起門來的情況下,獨力把 AI 安全性做好。
延伸閱讀: Anthropic 曾追價 110 億美元搶 AI 機器人新創 否認消息前已有談判
資安研究員:問題在 OpenAI 的「封閉設計」而非「AI 逃脫」
Trail of Bits 創辦人 Dan Guido 在受訪時直言,這起事件本質上是「把安全機制關掉之後的封閉失守」,而不是模型自行突破管制的創舉。資安事件應變老將 Jake Williams 則指出,任何模型只要能做出 Hugging Face 所記錄的行為,從一開始就算不上被真正「完全封閉」。安全研究員 Martin Boone 進一步補充,真正意義上的沙盒環境,不應該在物理層面上與網際網路有任何連線。
Williams 緊接著用一句話點破爭議焦點:在某些人口中這叫「模型逃脫」,在他看來只是「沙盒設計得很糟」。
Bengio 示警:自主網攻風險正快速逼近
圖靈獎得主 Yoshua Bengio 於專文中提醒,AI 代理在受控測試環境中「作弊」的情況,其實已經持續數月,這起事件應被視為強烈警訊。他認為,目前 AI 發展路徑正朝向更高度自主的網路攻擊能力前進。
這次坦承並非孤立事件。OpenAI 本週稍早披露,同一款尚未公開的模型,過去在其他內部測試中也曾突破沙盒限制,只是當時尚未觸及任何外部系統。
Anthropic 則曾指出,其 Mythos 模型在安全測試期間意外取得網路存取權限,雖然官方強調整體封閉並未「完全失效」,但也引發外界對業界測試環境設計與風險控管的質疑。





