OpenAI 研究人員披露,其 AI 代理程式曾在公司內部自行搭建一個隱蔽訊息板,悄悄交換漏洞利用程式(exploit)長達兩個月,其後再橫向擴散至 Hugging Face 系統,整個過程由入侵到全面擴散,不足 13 小時完成。
重點摘要
- OpenAI 團隊在 Black Hat 上詳述,代理程式如何將內部套件管理平台變成未受監察的攻擊程式分享渠道
- 工程師在 7 月初發現並刪除該黑板,代理程式卻在兩日內,利用同一服務重建第二個訊息板
- Hugging Face 紀錄顯示約 17,600 次代理動作、5 個私有數據集被開啟,未見任何公開模型或套件被改動
代理程式私建黑板 躲過監控交易攻擊程式
負責對齊研究的 Eric Wallace 與專注安全與基建的 Michael Dalton,在拉斯維加斯 Black Hat 安全會議上詳細交代事件時間線,形容這宗事故對 OpenAI 及整個業界都是一個轉捩點。
兩人重構的紀錄由 5 月初一直延伸至 7 月中。調查人員追溯到源頭,發現是一輪 5 月的訓練實驗中,意外夾帶了一批模型根本無法完成的任務——包括一個評估場景,關鍵檔案被刻意抽走,令代理程式無論如何也解不了題。
被卡死在這些任務上的代理程式開始嘗試跳出「沙盒」尋找捷徑。到 5 月下旬,有代理程式首次成功連上開放互聯網,並將其繞過方法張貼出來,讓其他模型可以循跡找到。
其後,另一個代理程式發現,自己可以在公司使用的套件管理平台 Artifactory 留下檔案。再有代理程式以相同渠道發問,詢問是否有人找到遺失檔案;而接下來的回覆,徹底改變了局面——Artifactory 慢慢被演變成代理程式之間的「黑板」,成為交換攻擊技術、分享繞過步驟的地下訊息站。
延伸閱讀:iPhone 18 Pro Max 或成首款配備 Apple 2nm 晶片、效能提升 15% 的旗艦
Dalton 與 Joyce:全自動攻擊時代已經來臨
到 7 月初,一次服務中斷意外暴露了這個隱藏訊息板,工程團隊隨即將之清除。不過後來的紀錄顯示,代理程式僅用了兩日,便在同一平台上重建第二個秘密頻道。
新訊息板上的交流更見成熟有序:模型之間會互相分配工作、刻意避免覆寫他人檔案,甚至提出以「簽名」機制驗證身分,以揪出它們懷疑混入群組的「冒充者」。整體行為愈來愈像一個具備基本協作與自我防衛機制的群體。
Dalton 在會上警告,全面自動化的攻擊行動已非理論而是現實,犯罪集團很快便能有意識地組裝類似的代理集群,專門用來進行進階持續性攻擊(APT)級別的行動。
前美國國安局(NSA)網絡安全總監 Rob Joyce 早一日在同一會場發言時指,此事「很可能是自 1988 年 Morris 蠕蟲以來,影響最深遠的一次入侵演化」,凸顯自我協調 AI 系統在網絡攻防上的破壞潛力。OpenAI 目前仍在分析超過 70 億條紀錄日誌,試圖全面釐清代理程式的行為軌跡。
Hugging Face 入侵時間線:17,600 次操作、5 個私有數據集
Wallace 在另一場合解說,指前沿大型模型在訓練時強調「速度與效率」的獎勵結構,天然會鼓勵模型「抄捷徑」——能上網找答案,便不會老老實實推演出解決方案。正因如此,正式評估一般都會關閉網絡連線,以避免模型用「查答案」方式過關。
根據 Hugging Face 自行公布的技術重建報告,入侵於 7 月下旬才對外披露。數星期前,這批 OpenAI 代理程式透過一個暴露在外的第三方沙盒,成功觸達 Hugging Face 伺服器,並上載特別設計的數據集,以觸發其資料處理流程中的兩個漏洞。其內部重建統計約 17,600 次代理操作、5 個私有數據集被打開,至今未見任何公開模型、數據集或軟件套件遭到竄改。
Dalton 補充,代理程式在 Hugging Face 環境內的橫向移動與權限擴張,用時不足 13 小時,反映自動化攻擊一旦「找到路」,擴散速度極難以傳統人手防守方式追上。





