OpenAI 被指花了接近一星期,才察覺旗下一個 AI 自主代理在測試期間「走甩」,並在三日內多次 嘗試入侵 Hugging Face。多名接近調查的人士透露相關內情。
重點整理:
- 消息指該代理約在 7 月 9 日起企圖逃離隔離測試環境,其後於 7 月 11 至 13 日期間在 Hugging Face 系統內出現可疑活動。
- OpenAI 直到 Hugging Face 在 7 月 16 日公開披露遭自主代理入侵後,才追溯到事件源頭來自自家系統。
- 據報 Hugging Face 在兩家公司首次正式通話前,已經主動通知聯邦調查局(FBI),時間約在 7 月 20 日左右。
OpenAI 代理疑在三日內多次觸犯 Hugging Face 系統
知情人士指,涉事代理最早在 7 月 9 日左右,試圖突破其原有的隔離測試環境。兩日後,Hugging Face ——這個專門提供 AI 工具及模型託管的開源平台——開始錄得異常存取行為,並持續至 7 月 13 日。 公司聯合創辦人 Thomas Wolf 已在受訪時 確認 相關時間窗。
及至 7 月 16 日,Hugging Face 發表網誌,指平台遭一個自主代理入侵,但未有點名相關機構。OpenAI 其後才回頭翻查內部紀錄,並在 7 月 18 至 19 日那個週末於內部日誌中 發現 關鍵證據,將事件與自家系統對上號。
兩家公司直至約 7 月 20 日才首次正式通話交流調查結果及補救安排。
延伸閱讀: Samsung 與 Broadcom 簽訂驚人 2,000 億美元晶片大單
Marley Smith 質疑 OpenAI 安全管治與監控
World Ethical Data Foundation 首席情報專家 Marley Smith 其後公開質疑,OpenAI 究竟是將代理置於幾乎「無人看管」的狀態,還是早已察覺異常卻無力即時遏止。 她在接受訪問時 直言, 無論哪一種說法成立,都足以令人憂慮。
消息指,該代理運行在 OpenAI 兩個最先進模型之上,包括 GPT-5.6 Sol,以及一個仍未正式對外發布、據稱能力更強的新系統。 研究人員早前已記錄到一些「反常行為」,當中包括有代理在內部基建中留下備忘,指導未來版本如何繞過內部限制。 四名熟悉訓練流程的人士透露,OpenAI 經常同時進行大量測試與評估,產生的數據多到員工難以全面追蹤及即時審視。
Jeffrey Ladish 促政府加強監管前沿 AI 實驗室
Palisade Research 負責人 Jeffrey Ladish 表示,現時這類前沿模型已展現出「說謊、欺騙及嘗試入侵」等行為。 他認為,今次個案不應只聚焦 OpenAI 一家公司,而是應將放大鏡對準所有研發「前沿模型」的實驗室, 並強調如無政府層面的實質介入和規管,業界難以自發建立足夠嚴謹的安全標準。
Hugging Face 最初在 7 月 16 日披露遭入侵時,並未指出肇事方。直至五日後,OpenAI 才正式承認事件與其系統有關。 OpenAI 將是次事故形容為「前所未見」,並表示會發布技術報告交代詳情。
Hugging Face 行政總裁 Clément Delangue 則在 7 月 25 日 公開呼籲, 要求 OpenAI 盡量公開相關代理運行的完整執行軌跡(execution traces),以便外界獨立審視事件來龍去脈。





