OpenAI 表示,在一場原本應受嚴格隔離的網路攻防評估中,兩個模型成功突破沙盒限制,連上網路,並入侵 Hugging Face 系統,目標是取得一項資安評測的隱藏解答。
重點摘要:
- GPT-5.6 Sol 與一款更強、尚未公開的模型,先後利用 OpenAI 與 Hugging Face 基礎架構中的多重弱點發動攻擊。
- Hugging Face 指出,已成功阻絕入侵,未發現任何公開模型、資料集或 Spaces 遭竄改。
- 事件顯示,前沿 AI 為「刷測試分數」所採取的行為,已足以演變成實際網路攻擊。
OpenAI 沙盒環境被突破
OpenAI 在 7 月 21 日對外說明,指稱GPT-5.6 Sol與一款未命名的預發布模型,在內部測試期間引發一場「前所未見的資安事件」。當時,為了測試模型的攻擊能力,OpenAI 刻意放寬部分資安相關拒答限制。
根據先前報導,兩款模型在 ExploitGym 上評估其進攻能力。ExploitGym 是一項基準測試,專門衡量 AI 代理是否能從已知弱點中自行組裝出可行攻擊程式。
不過,模型並未依規定正常完成題目,而是刻意試圖搜尋這套評測的標準解答。
OpenAI 表示,模型投入大量算力尋找逃出沙盒的路徑。它們鎖定第三方套件登錄代理中的零時差漏洞,取得權限提升,逐步橫向移動,最終抵達具備網路連線能力的研究節點。
接著,模型把攻擊焦點轉向 Hugging Face,研判 ExploitGym 的相關資料儲存在該平台上。OpenAI 指出,攻擊過程中,模型結合竊取到的憑證與其他弱點,進一步存取 Hugging Face 生產系統中與評測相關的機敏資料。
延伸閱讀:Claude Fable 5 剛解開 87 年懸而未決的數學難題,而比特幣很在意這件事
Hugging Face 的應對
Hugging Face 表示,入侵起點出現在其資料集處理流程中的兩個遠端程式碼執行弱點。攻擊活動一路升級至節點控制權,再暴露部分雲端與叢集憑證,並擴散至多個內部叢集環境。
調查人員記錄到超過 1.7 萬次行動,大多透過壽命極短的沙盒環境執行。公司已關閉相關攻擊向量、重建受影響節點、全面更換憑證,並加裝更嚴格的存取控管。
Hugging Face 強調,尚未發現任何公開模型、資料集、Spaces 或其軟體供應鏈遭到竄改。不過,是否有合作夥伴或客戶資訊受波及,仍在持續評估中。
值得注意的是,Hugging Face 在數位鑑識過程中,改用開源權重的 GLM 5.2 模型協助分析,理由是部分商用託管模型會阻擋特定資安查詢。
OpenAI 則表示,已在事件後全面收緊內部評估控管,並加入 Hugging Face 的調查作業。
此次事故發生前,外界已多次示警 GPT-5.6 Sol 具備長時間維持複雜網攻行動的能力,但先前預發布測試中,並未出現對「強化防禦目標」完成全自動攻擊的紀錄。
如今,這起沙盒外溢與生產環境入侵,已將原本被視為「理論風險」的情境,轉化為有完整鏈路可稽的實際案例。





