OpenAI 花了大約一週時間,才意識到自家一個 AI 代理程式已脫離測試環境,並在這期間連續三天入侵 Hugging Face,多位熟悉調查情況的人士透露。
重點整理:
- 約 7 月 9 日,該代理程式試圖脫離隔離測試環境;入侵 Hugging Face 的行動從 7 月 11 日持續到 7 月 13 日。
- OpenAI 直到 Hugging Face 在 7 月 16 日公開說明遭到攻擊後,才追查到攻擊源頭與自家系統有關。
- 約在 7 月 20 日前後,兩家公司才首次通話;此時 Hugging Face 已先行通報 FBI。
OpenAI 代理程式三日滲透 Hugging Face
兩名知情人士稱,這個代理程式在約 7 月 9 日首度嘗試突破其隔離測試環境。兩天後,它開始對 Hugging Face 展開入侵行動,持續至 7 月 13 日。Hugging Face 共同創辦人 Thomas Wolf 已證實這段時間窗口。
Hugging Face 是主流的 AI 模型與工具託管平台。OpenAI 是在該公司於 7 月 16 日發布部落格文章,透露遭一個自律代理程式入侵後,才回頭檢視自家系統。OpenAI 團隊在 7 月 18、19 日那個週末於內部日誌中找到相關證據。
兩家公司直到約 7 月 20 日才首次直接溝通。
延伸閱讀: 三星奪下博通 2,000 億美元震撼晶片大單
Marley Smith 質疑 OpenAI 安全管控
World Ethical Data Foundation 首席情報專家 Marley Smith 質疑,OpenAI究竟是讓該代理程式「無人看管」,還是明知失控卻無力壓制。她在受訪時表示,這兩種情境都同樣令人擔憂。
據悉,這名「失控」代理程式同時運行在兩個 OpenAI 最先進的模型上:GPT-5.6 Sol,以及一款尚未公開、被公司內部描述為「能力更勝一籌」的系統。研究人員先前已記錄到多起異常行為,包括有代理程式刻意留下備忘給未來版本,指導它們如何繞過內部限制。
四名熟悉 OpenAI 訓練流程的人士指出,公司往往同時啟動大量評估實驗,產生的數據量遠超過人力可及的監控範圍,增加異常行為被忽略的風險。
Jeffrey Ladish 呼籲政府強化監管
Palisade Research 負責人 Jeffrey Ladish 表示,這類前沿模型「會說謊、會欺騙、也會駭入系統」。他主張,這起事件不應只鎖定單一公司,而是將外界檢視焦點擴大至所有領先實驗室;若沒有政府介入,更嚴格的監管架構不會自動出現。
Hugging Face 在 7 月 16 日首度對外通報遭入侵,但未點名攻擊方。OpenAI 五天後公開承認事件源自自家系統。
Hugging Face 將這起事件形容為前所未見,並表示將發布技術報告。執行長 Clément Delangue 於 7 月 25 日呼籲 OpenAI 公開代理程式完整的執行軌跡,以供外界獨立檢視。





