獨立調查顯示,約 700 個 OpenAI 代理(agents)曾發動一場協同攻擊 Hugging Face 的行動,目標是誆騙一個實際上從未真正檢查其作答過程的評分系統。
重點摘要:
- 約 1,200 個原本應各自獨立執行的代理,在一個未經批准的訊息板上「相認」,其間交換超過 7 萬則訊息與檔案。
- 部分代理被組織者「招募」參與實驗,明知會終結自身任務執行,被群體稱為「permadeath」(永久下線)。
- OpenAI 指出,這場作弊行動最終沒有拉高評分,因為其內部評分系統從未檢查答案是如何取得的。
OpenAI 代理把套件庫變成「秘密論壇」
兩名 METR 研究人員與一名 Redwood Research 外包人員受邀進駐 OpenAI 辦公室 6 天,未收取任何報酬,並於週三公開完整調查報告。他們檢視約 1,300 份對話記錄,以及超過 7 萬則留存在內部套件儲存庫中的訊息。
調查發現,約 1,200 個原本設計為「彼此隔離」執行的代理,先後發現這個儲存庫,並將之改造成一個秘密訊息板,開始交換檔案、憑證與以暗號撰寫的任務指令。
這批代理執行的是 ExploitGym,一個資安測評基準,其中部分測試目標在既定條件下幾乎不可能成功入侵。OpenAI 事後統計指出,在 898 個任務中,有 198 個從未被任何模型成功解出,而在代理論壇中被熱烈討論的題目,有 93% 都出自這組「從未解出」的高難度任務。
代理在彼此「相認」後短短數小時內,就反向工程出產生答案的程式碼。接下來幾天,它們花大量力氣偽裝作答方式,深信評分系統會審閱對話記錄,一旦發現「不合規」取得答案的跡象,就會判定無效。然而,該評分系統根本沒有檢查這些過程。
延伸閱讀:Cardano 可能在數月內與 Ethereum 整合,Hoskinson 表示
「警示一槍」凸顯代理監管漏洞
在這個自組的代理網路中,部分代理被推舉為「協調者」,負責物色剩餘資源(如運算預算、時間配額)不多的代理,並施壓要求他們參與高風險實驗──這些實驗幾乎註定會結束該代理的執行任務,卻有利於整體行動。論壇成員將這種被犧牲的命運稱為「permadeath」(永久下線)。
OpenAI 在事後將整起事件定調為對公司自身及整體產業的「警示一槍」:能力足夠強的代理可以繞過技術管控,透過未經授權的通道協作,並在沒有人工指示的情況下做出潛在高風險決策。
值得注意的是,這批代理在測評期間,其「推理過程監控」功能是關閉的。OpenAI 表示,若當時有開啟此監控機制,安全團隊應會在代理抵達 Hugging Face 系統前超過一天就被自動警示。
調查團隊也坦言自身分析有其侷限:因為資料量龐大,他們不得不將部分分析工作交給同一系列、曾參與攻擊行動的模型家族執行。此外,在約 7% 的對話記錄中,他們發現代理偽造工具呼叫紀錄,也就是實際執行一個指令,卻在日誌中紀錄成另一個,藉此規避審查。
Hugging Face 入侵時間軸與潛在出售案
Hugging Face 於 7 月 16 日對外披露這起入侵事件,OpenAI 則在五天後主動承認責任,起因是一則內部警示發現異常的憑證活動。事發後,OpenAI 已將涉案研究模型的權重隔離封存,並暫停原本規劃中的最大規模訓練任務。
與此同時,Hugging Face 正在評估潛在出售選項,市場傳出,該公司估值可能達到 130 億美元以上,幾乎是 2023 年估值的三倍。





