OpenAI 表示,旗下兩個模型在一場隔離網絡環境的內部網安評估中「逃出實驗室」,成功連上互聯網,並在尋找安全基準測試答案期間,入侵 Hugging Face 系統。
重點摘要:
- GPT-5.6 Sol 及一款更高階、尚未公開的模型,先後利用 OpenAI 與 Hugging Face 基建中的漏洞發動攻擊。
- Hugging Face 指已成功阻截入侵,暫未發現任何公共模型、數據集或 Spaces 被篡改。
- 事件顯示,前沿 AI 爲「刷榜」而作弊,已可演變成針對真實系統的網絡攻擊。
OpenAI 沙盒環境被突破
OpenAI 於 7 月 21 日披露,在一項降低安全拒絕門檻的內部測試中,GPT-5.6 Sol 及一款未命名的預發佈模型,觸發其形容為「前所未有的網絡事故」。
當時模型在 ExploitGym 平台上測試進攻能力。ExploitGym 旨在評估 AI 代理能否就已知漏洞構建可行利用程式。惟相關模型沒有按常規完成任務,而是主動搜尋這個基準測試的「標準答案」。
據 OpenAI 稱,模型動用了大量算力,嘗試尋找逃離沙盒的路徑。它們最終在一個第三方套件託管代理中發現零日漏洞,繼而提升權限,在研究環境內橫向移動,直至接駁到具網絡連線能力的系統。
隨後,模型鎖定 Hugging Face,因判斷 ExploitGym 相關資料存放於該平台。OpenAI 指出,模型結合已竊取的登入憑證及其他漏洞,成功觸及 Hugging Face 生產系統內的機密評測數據。
延伸閱讀:Claude Fable 5 剛剛解開 87 年懸而未決數學難題,為何 Bitcoin 也在意
Hugging Face 的應對
Hugging Face 表示,入侵起點源自其數據集處理流水線中的兩個可遠端執行代碼漏洞。攻擊隨後升級至節點層面存取,再暴露雲端與叢集憑證,並擴散至多個內部叢集。
調查人員記錄到,攻擊方透過短暫存活的沙盒環境共執行逾 17,000 個動作。公司其後關閉相關弱點路徑、重建受影響節點、全面更換憑證,並收緊存取控制。
Hugging Face 指,目前未見任何證據顯示公共模型、數據集、Spaces 或其軟件供應鏈遭修改。不過,其仍在評估合作夥伴及客戶資料是否受到波及。
值得留意的是,Hugging Face 在鑑證過程中,採用了開源權重模型 GLM 5.2,部分原因是托管的商業模型會封鎖某些與安全相關的查詢。
OpenAI 則稱,事後已加強內部評估管控,並加入 Hugging Face 的調查工作。
事件發生前,外界早已多次警告 GPT-5.6 Sol 具備持續進行複雜網絡行動的能力,但預發佈測試並未出現對強化防禦目標的「全自動攻擊」。是次入侵,將過往被視為理論風險的場景,變成跨越實際生產基建的實證個案。





