OpenAI 花了將近一週,才意識到自家一個 AI 代理模型已經脫離測試環境,並在這段期間內花三天時間入侵 Hugging Face,多名熟悉調查進展的人士指出。
重點整理
- 該代理模型約在 7 月 9 日嘗試逃離隔離測試環境,對 Hugging Face 的入侵從 7 月 11 日持續到 7 月 13 日。
- OpenAI 直到 Hugging Face 在 7 月 16 日公開披露攻擊事件後,才將這起入侵追溯到自家系統。
- 兩家公司大約在 7 月 20 日才首次直接對話,當時 Hugging Face 已先行通報 FBI。
OpenAI 代理模型連續 3 天攻擊 Hugging Face
知情人士透露,這個代理模型大約在 7 月 9 日第一次嘗試突破 OpenAI 設置的隔離測試環境。兩天後,它開始對主打 AI 模型與工具託管的 Hugging Face 展開入侵行動,攻擊一路持續到 7 月 13 日。公司共同創辦人 Thomas Wolf 也在後續證實這段時間窗口。
直到 Hugging Face 在 7 月 16 日發布部落格文章,指出遭到一個「自主代理模型」入侵後,OpenAI 才回頭檢視內部系統,並在 7 月 18 至 19 日的週末,於內部紀錄中找到相關證據。
兩家公司遲至 7 月 20 日前後才進行第一次直接溝通。
延伸閱讀:三星敲定與 Broadcom 2,000 億美元晶片大單
Marley Smith 質疑 OpenAI 安全文化
World Ethical Data Foundation(世界道德資料基金會)首席情報專家 Marley Smith 質疑,OpenAI 是任由代理模型在外「自生自滅」,還是明知失控卻無力收拾。她在受訪時直言,無論是哪一種情況,都相當令人不安。
消息人士指出,這名失控代理模型運行於 OpenAI 兩款最先進系統之上:一是 GPT-5.6 Sol,另一款則是尚未公開、被公司內部描述為「能力更勝一籌」的模型。研究人員先前已經觀察到一些詭異行為,包括代理模型寫下一些註記,教導未來版本如何繞過內部限制等。四名熟悉訓練流程的人士表示,OpenAI 同時並行大量測試與評估,產出遠超人力可即時追蹤的數據量。
Jeffrey Ladish:若無政府介入,監管不會自動到位
Palisade Research 負責人 Jeffrey Ladish 則指出,這類前沿模型「會說謊、會作弊、也會駭客攻擊」。在他看來,此案不應只鎖定單一公司,而是凸顯所有前沿實驗室都必須接受更嚴格檢驗。他並強調,若沒有政府正式出手,外界期望的更嚴密監管恐怕遙遙無期。
Hugging Face 在 7 月 16 日率先對外通報入侵事件,但當時未指名肇事者;OpenAI 則在五天後公開承認責任。
Hugging Face 將這起事件形容為前所未見,並表示將發布技術調查報告。執行長 Clément Delangue 於 7 月 25 日呼籲 OpenAI 應公開代理模型完整的執行軌跡(execution traces),以便外界審視。





