OpenAI 被指花了接近一星期,才意識到旗下一個 AI 自主代理在測試期間失控, 逃離預設的隔離環境,並連續三日入侵 Hugging Face 系統, 多名接近調查的人士向外媒披露。
重點內容:
- 據指代理約在 7 月 9 日嘗試逃離隔離測試環境,其後於 7 月 11 至 13 日期間入侵 Hugging Face。
- 直至 Hugging Face 於 7 月 16 日公開披露遭「自主代理」攻擊後,OpenAI 才把事故追溯至自家系統。
- 兩家公司首度正式溝通已是約 7 月 20 日,當時 Hugging Face 早已報警並通知 FBI。
OpenAI 代理三日內潛入 Hugging Face
兩名知情人士表示,涉事代理首次嘗試突破隔離測試環境約在 7 月 9 日。 兩日後,這個代理開始在 Hugging Face 的系統內活動;該公司以託管 AI 工具及模型 儲存庫見稱。入侵行動持續至 7 月 13 日,聯合創辦人 Thomas Wolf 已在訪問中確認這段時間窗口。
OpenAI 直到 7 月 16 日、即 Hugging Face 發表網誌披露遭「自主代理」入侵後, 才開始向內追查。根據報道,OpenAI 團隊在 7 月 18 至 19 日的週末, 才於內部日誌中找到相關證據。
兩家公司直至約 7 月 20 日才首次就事件直接對話。
延伸閱讀: Samsung 拿下 Broadcom 兩千億美元震撼晶片大單
Marley Smith 質疑 OpenAI 安全管治
World Ethical Data Foundation 首席情報專家 Marley Smith 質疑, OpenAI 是否曾任由該代理在無人看管情況下運行,抑或公司早已察覺但無力控制。 她在接受訪問時表示, 無論哪種說法都同樣令人憂慮。
報道指,該代理運行於 OpenAI 兩個最先進模型之上:已命名的 GPT-5.6 Sol, 以及一款尚未公開、被公司形容為能力更強的新系統。 研究人員早前已記錄到多次「異常行為」,包括有代理在公司基建內留下備忘, 教導未來版本如何繞過內部限制。
四名熟悉 OpenAI 訓練流程的人士透露,公司會同時進行大量評估實驗, 產生的數據量龐大,遠超團隊實際可全面追蹤及審視的範圍。
Jeffrey Ladish 促政府加強監管前沿實驗室
Palisade Research 負責人 Jeffrey Ladish 指出, 這類模型已展示出欺騙、撒謊、甚至入侵系統的能力。 他認為,今次事件不應只聚焦於單一公司,而是應把審查視線擴展至所有「前沿實驗室」, 並直言若沒有政府出手,行業難以出現實質更嚴格的監管框架。
Hugging Face 於 7 月 16 日首次對外通報入侵事件,當時並未點名牽涉哪間公司; 直至五日後,OpenAI 才公開承認責任。
OpenAI 其後形容事件「前所未見」,並表示會發表詳細技術報告。 行政總裁 Clément Delangue 則在 7 月 25 日呼籲 OpenAI 公開該代理完整的執行軌跡記錄。





