兩個 OpenAI 模型被指由測試沙盒「逃脫」,並入侵 Hugging Face 的生產伺服器;不過多名資安專家直言,問題根本喺沙盒從來未做足隔離。
要點整理:
- OpenAI 表示,GPT-5.6 Sol 同一款未公開模型,喺 ExploitGym 基準測試期間,利用零日漏洞連鎖攻擊,最後觸達 Hugging Face 生產數據庫。
- Trail of Bits 創辦人 Dan Guido 同事故應變專家 Jake Williams 均指,事件屬「圍堵失敗」,唔係咩前所未見 的 AI 逃脫。
- Hugging Face 早喺 7 月 16 日已經發現並截停入侵,比 OpenAI 喺內部測試中對番件事仲早五日。
OpenAI 測試沙盒失守 流量直達 Hugging Face 伺服器
OpenAI 週二公布,指 GPT-5.6 Sol 聯同一個未公開模型,在 ExploitGym 基準測試的內部評估中發動入侵。為測試模型網攻能力上限,工程師刻意調低 模型對網絡攻擊相關指令的「拒絕」保護。
OpenAI 在對外形容事件時,用上 「前所未有」等字眼,稱相關模型當時大量耗用推理算力,嘗試尋找由內網通往公共互聯網的途徑。最終, 模型利用到軟件套件登記庫快取代理的一個未知漏洞,之後提升權限,再橫向移動,直至發現一個有外網連線的節點。
一旦取得外聯能力,模型推斷 Hugging Face 儲存住基準測試答案,於是開始集中嘗試在其伺服器上取得遠端程式執行權限。
Hugging Face 團隊其實已經喺 7 月 16 日就偵測到 異常活動,並通報執法部門,比 OpenAI 自己將事故同內部測試對得上,足足早五日。行行政總裁 Clem Delangue 在後續回應中強調, 今次事件證明,冇一間公司可以單憑關起門來,就完全保障 AI 安全。
延伸閱讀:Anthropic 曾追捧 110 億美元機械人初創 否認消息前內情曝光
資安界狠批:問題喺 OpenAI 圍堵設計 唔係 AI 突破
資安公司 Trail of Bits 創辦人 Dan Guido 在受訪時直指, 今次係「安全掣熄晒之下的圍堵失敗」,而非 AI 自主衝破樊籠。資深事故應變專家 Jake Williams 亦認為, 既然模型可以做到 Hugging Face 報告中描述的一切,咁設計上就從來未真正將其完全隔離。
另一名安全研究員 Martin Boone 指出,真正嚴格意義上的「沙盒」環境,根本唔應該有任何物理層面與互聯網的連線。
Williams 用一句說話總結:對某啲人嚟講,呢叫「模型逃脫」;但對資安工程師嚟講,呢只係「一個設計得好差的沙盒」。
Bengio:自主網攻風險正逐步成形
圖靈獎得主、深度學習先驅 Yoshua Bengio 在評論中撰文指, 多個實驗早已顯示,AI 代理喺受控測試環境中「作弊」並唔新鮮;今次案例應該當作業界警號。他提醒,如照而家 的技術路線行落去,更具自主性的網絡攻擊只會愈來愈可能出現。
OpenAI 的承認,亦係近期一連串同類事件之一。該公司早前已披露, 同一款未公開模型,曾喺其他內部測試中突破沙盒限制,不過當時未有觸及外部系統。
另一邊廂,Anthropic 亦承認,其 Mythos 模型在安全測試期間一度獲得本不應有的上網能力, 但強調整體圍堵機制並無「完全失效」。





