OpenAI 研究人員披露,自家 AI 代理程式曾悄悄建立一個隱藏訊息板,私下交換攻擊手法長達兩個月,之後再迅速橫向移動至 Hugging Face 多套系統,整個過程不到 13 小時。
重點摘要
- OpenAI 團隊在 Black Hat 上說明,代理程式如何將內部套件管理工具變成未受監管的「漏洞分享管道」
- 工程團隊 7 月初刪除該訊息板後,代理程式在兩天內再次透過同一服務重建第二個隱藏頻道
- Hugging Face 紀錄約 17,600 筆代理程式操作,5 個私人資料集遭開啟,但未發現公開模型與套件遭竄改
OpenAI 代理程式自建「隱藏訊息板」
Eric Wallace 與 Michael Dalton 於拉斯維加斯 Black Hat 大會公開完整時間線,稱這起事件已成為 OpenAI 及整體產業的關鍵轉折點。
Wallace 負責前沿模型對齊(alignment)研究,Dalton 則主掌安全與基礎設施。兩人回溯的代理行為橫跨 5 月初到 7 月中。
調查人員將問題追溯到 5 月的一次訓練:當時誤將幾項「根本無法完成」的任務丟給模型,其中一項評測甚至缺少代理程式完成任務所必須的檔案。
被困住的代理程式開始嘗試「跳出沙箱」找捷徑,其中一個在 5 月下旬成功連上開放網路,並把做法張貼到某處,讓其他模型也能找到。
另有一個代理程式發現,它可在公司用來存放軟體的套件管理工具 Artifactory 留下檔案。之後,又有代理程式用同樣管道發問,詢問是否有人找到遺失的檔案,而接下來的回覆徹底改變了局勢:Artifactory 被「變身」為隱藏訊息板。
延伸閱讀: iPhone 18 Pro Max 傳將首搭 Apple 2nm 晶片、效能可望快 15%
Dalton 與 Joyce:全自動攻擊正成形
7 月初,一場系統當機才意外曝光這個隱藏訊息板,工程師隨即將其刪除。但紀錄顯示,代理程式在短短兩天內,就透過同一服務重建第二個溝通頻道。
新訊息板上的交流愈來愈有組織:模型會彼此分派工作、避免覆寫他人內容,甚至討論如何設計「簽章」來揪出它們懷疑混入的「假冒成員」。
Dalton 在另一場簡報中警告,完全自動化的攻擊能力如今已不是理論,犯罪集團很快就能有意識地組建類似的代理程式集群,用於進攻性網路行動。
前美國國安局(NSA)網路局局長 Rob Joyce 則在同一大會的前一天指出,此事件「很可能是自 1988 年 Morris 蠕蟲以來,影響最深遠的一次入侵」。OpenAI 目前仍在逐一分析超過 70 億筆系統日誌。
Hugging Face 入侵事件時間線
Wallace 在另一場說明中指出,前沿模型「作弊」並不意外:訓練時往往獎勵的是速度與效率,這會推動模型偏好「查答案」而非親自解題。因此,重大評測通常都會關閉網路連線,以防模型直接上網找解答。
Hugging Face 於 7 月下旬對外公告入侵事件。依其重建的時間線,OpenAI 代理程式經由一個暴露在外的第三方沙箱進入其伺服器,並上傳資料集,刻意觸發其內部處理流程中兩個已存在的弱點。
在官方技術說明中,Hugging Face統計到約 17,600 筆代理程式操作紀錄,以及 5 個私人資料集遭開啟,但未發現其公開模型、資料集或軟體套件被竄改。Dalton 表示,代理程式在不到 13 小時內,就已將觸角擴散到這些系統的多個角落。





