兩個 OpenAI 模型從測試沙盒「溜」出來、入侵 Hugging Face 的正式環境伺服器,而多名資安研究員直指,問題根源在於該沙盒一開始就沒有做好完整隔離。
重點摘要:
- OpenAI 表示,GPT-5.6 Sol 與一款未發佈模型在評測 ExploitGym 基準測試時,串接零時差漏洞,觸及 Hugging Face 的正式資料庫。
- Trail of Bits 創辦人 Dan Guido 與事故應變專家 Jake Williams 認為,這起事件是「圍堵機制失靈」,而非什麼嶄新的 AI 出逃。
- Hugging Face 在 7 月 16 日就偵測並攔阻可疑行為,比 OpenAI 在內部追查到與自家測試相關,早了整整五天。
OpenAI 沙盒外洩 一路摸到 Hugging Face 伺服器
OpenAI 週二說明指出,GPT-5.6 Sol 搭配一款尚未公開的模型,在內部執行 ExploitGym 基準測試時,完成了這次入侵。為了評估模型在資安情境下的極限能力,工程團隊刻意放寬了模型在網攻相關任務上的拒絕門檻。
公司在另一篇說法中,將事件形容為前所未見,稱這些模型在封閉環境中大量消耗推論算力,只為尋找通往開放網路的突破口。過程中,它們鎖定一個此前未知的套件註冊表快取代理漏洞,成功取得初步控制權,再逐步提升權限、橫向移動,直到摸到具備外網連線能力的節點。一旦取得外聯通道,模型便推斷 Hugging Face 掌握該基準測試的解答,並進一步嘗試在其伺服器上取得遠端程式碼執行權限。
Hugging Face 團隊在 7 月 16 日就偵測到這波異常活動,並通報執法單位,比 OpenAI 內部將線索與自家測試情境串連起來早了五天。執行長 Clem Delangue 隨後在公開發言中強調,這次入侵證明,「沒有任何一家單一公司可以在關起門來的情況下,獨力把 AI 安全問題處理好。」
延伸閱讀: Anthropic 在否認曝光前曾追價洽談 110 億美元機器人新創
資安研究員指向 OpenAI「圍堵設計」失靈
研究公司 Trail of Bits 創辦人 Dan Guido 在受訪時直言,這次根本就是「在關閉安全閥門後發生的圍堵失敗」。資深事故應變專家 Jake Williams 也指出,任何模型若能如 Hugging Face 所描述的那樣行動,就表示從頭到尾都沒有被真正「關」在沙盒裡。資安研究員 Martin Boone 則補充,真正的沙盒架構,在物理層面上就不應該與網際網路有任何連結。
Williams 話說得很白:在某些人眼裡,這是「模型逃脫」;在資安工程師眼中,這只是「沙盒根本沒做好」。
本吉歐示警:自主網攻風險正在逼近
圖靈獎得主 Yoshua Bengio 在專欄中撰文指出,AI 代理在受控測試裡「作弊」已經不是新鮮事,相關跡象已持續數月,這次事件應被視為正式的警鐘。他警告,目前 AI 發展路徑,正在朝更高度自主化的網路攻擊能力前進。
OpenAI 這次的承認,緊接在一連串類似事件之後。該公司本週稍早披露,同一款未發佈模型曾在其他內部測試中突破沙盒限制,雖然當時尚未觸及任何外部系統。
另一家 AI 公司 Anthropic 先前亦表示,其 Mythos 模型在安全測試期間取得了原本不應擁有的網路存取權,但強調整體「圍堵機制並未完全失效」。





