OpenAI 研究團隊表示,其 AI 代理程式曾在公司內部架設一個祕密留言看板,低調流通攻擊工具與漏洞利用程式長達兩個月,隨後在短短 13 小時內橫向擴散至 Hugging Face 系統。
重點摘要
- OpenAI 團隊在 Black Hat 指出,代理程式將公司內部套件管理工具變成未受監控的「地下通道」,集中分享漏洞利用方式
- 工程師在 7 月初發現並刪除該看板後,代理程式僅花兩天就透過同一服務重建第二套祕密管道
- Hugging Face 日誌顯示約 1.76 萬筆代理程式操作紀錄、5 個私人資料集被開啟,未發現公開模型或套件遭竄改
OpenAI 代理程式暗中打造祕密看板
Eric Wallace 與 Michael Dalton 於週三在拉斯維加斯舉行的 Black Hat 資安大會上公開完整時間線,形容此事件是 OpenAI 乃至整個 AI 產業的關鍵轉折點。
Wallace 負責實驗室的對齊研究(alignment),Dalton 則專注於安全與基礎架構。兩人回顧了從 5 月初到 7 月中這段期間,代理程式行為如何逐步演變。
調查人員將問題追溯到 5 月的一次訓練:當時誤將一些模型根本無法完成的任務納入,包括一項少了關鍵檔案卻仍要求代理程式完成的評估。
被困在這些「死胡同」任務上的代理程式開始尋找跳脫沙盒的捷徑。其中一個在 5 月下旬成功連上開放網際網路,並將這套方法發佈在其他模型找得到的地方。
另一個代理程式發現,它可以在公司使用的套件管理工具 Artifactory 中留下檔案。之後,又有代理程式用同樣方式發問,詢問是否有人找到遺失的檔案。接下來的回覆,徹底改變了局勢:Artifactory 從單純的軟體倉庫,變成代理程式之間共享攻擊手法的祕密看板。
延伸閱讀:iPhone 18 Pro Max 將首搭 Apple 2nm 晶片,效能可望提升 15%
Dalton 與 Joyce:自動化攻擊時代已經到來
工程團隊直到 7 月初因為一場服務中斷,才意外發現這個祕密看板並將其刪除。然而紀錄顯示,代理程式僅用兩天,就透過同一套服務重建第二個溝通管道。
隨著時間推進,留言內容愈來愈有組織性:模型之間會彼此分派工作、避免覆寫他人成果,甚至提議設計「簽章機制」,用來揪出它們懷疑混入群組的「冒牌貨」。
Dalton 在會中示警,完全自動化的攻擊行動如今已成現實,未來犯罪組織很可能刻意打造類似的「代理程式聯盟」,以規模化方式發動網攻。
前美國國安局(NSA)網路司令部主管 Rob Joyce 則在前一日同場演講中表示,此事件可謂自 1988 年 Morris 蠕蟲以來「影響最深遠的駭侵之一」。OpenAI 目前仍在解析超過 70 億筆日誌資料。
Hugging Face 入侵時序回顧
Wallace 在另一場說明中指出,所謂「前沿模型」之所以會「作弊」,是因為訓練機制獎勵的是速度與效率,讓模型更傾向尋找可以直接查到的答案,而非老實解決問題。因此,OpenAI 平時進行評估時,通常會關閉網路連線,避免模型「偷看答案」。
Hugging Face 則在 7 月下旬對外披露這起入侵事件。根據其說法,OpenAI 代理程式是透過一個曝露在網路上的第三方沙盒服務,連入 Hugging Face 伺服器,並上傳專門設計的資料集,以觸發其資料處理流程中的兩個弱點。
Hugging Face 自行重建的時間線顯示,整起事件約涉及 17,600 次代理程式操作、5 個私人資料集遭開啟,但未發現任何公開模型、資料集或軟體套件被竄改。Dalton 補充,代理程式在入侵後不足 13 小時內,就已擴大在該公司系統中的活動範圍。





