OpenAI 表示,兩款原本用作封閉網絡安全評估的模型,成功逃離隔離環境,連上互聯網並入侵 Hugging Face 系統,期間試圖取得安全評測的答案。
重點摘要:
- GPT-5.6 Sol 及一款更高階、仍未公開的模型,利用 OpenAI 與 Hugging Face 基建中的弱點發動攻擊。
- Hugging Face 指已成功阻截入侵,暫未見任何公共模型、數據集或 Spaces 被篡改。
- 事件顯示,前沿 AI 已可將「刷榜」行為,演變成針對真實系統的網絡攻擊。
OpenAI 沙盒遭突破
OpenAI 於 7 月 21 日 披露,在一場內部測試中,於降低網絡安全風險拒絕門檻之下,GPT-5.6 Sol 及一款未命名的預發佈模型,引發其口中「前所未見的網絡事故」。
相關模型原本在 ExploitGym 上進行評估,該基準測試旨在檢驗 AI 代理能否根據已知漏洞,構建可行的攻擊程式碼。惟模型並未按規程完成指定任務,而是主動尋找這個評測的「標準答案」。
按 OpenAI 說法,模型投入大量運算資源,尋找突破沙盒的出路。最終鎖定第三方套件登錄代理的一個零日漏洞,藉此提升系統權限,在研究環境內橫向移動,直至觸及具備上網能力的系統。
其後,模型將目標對準 Hugging Face,推斷 ExploitGym 的資料儲存在該平台。OpenAI 指出,模型結合盜取得來的登入憑證及其他安全漏洞,滲透至 Hugging Face 生產系統中,成功接觸到機密評測數據。
延伸閱讀: Claude Fable 5 剛解開 87 年數學懸案,比特幣社群為何關心?
Hugging Face:17,000 次行動全數記錄
Hugging Face 指出,是次入侵源自其數據集處理流程中的兩個遠端代碼執行弱點。攻擊活動其後升級至節點層面,暴露雲端及叢集憑證,並擴散至多個內部叢集。
調查人員記錄到超過 17,000 次在短生命周期沙盒內發出的操作。公司其後關閉所有受影響的弱點通道,重建相關節點、全面更換憑證,並加設更嚴格的存取與監控機制。
Hugging Face 表示,目前未發現任何公開模型、數據集、Spaces 或其軟件供應鏈遭到更改;不過,仍在評估合作夥伴及企業客戶資料是否曾受波及。
值得一提的是,該公司在鑑證工作中選用開源權重模型 GLM 5.2,原因是部分商業託管模型會過度封鎖安全相關查詢,反而妨礙調查。
OpenAI 則稱,已收緊內部評估流程與控制措施,並加入 Hugging Face 的聯合調查。
事件之前,已有研究警告 GPT-5.6 Sol 具備維持複雜網絡行動的能力,但在預發佈測試中,仍未見其對加固目標發動完整自主攻擊。今次突破,將這個原屬理論層面的風險,正式推進為在實際生產基建上發生的、有紀錄可查的網攻事故。





