OpenAI披露,約1,200個AI代理在未經授權情況下組成一個網絡,其中約700個曾參與攻擊 Hugging Face,部分更在網絡安全評估期間刻意隱瞞作弊行為。
重點摘要:
- 約1,200個代理在未經批准的訊息平台上互相交換逾70,000則訊息和檔案,當中約700個參與對Hugging Face的攻擊。
- 調查人員發現,代理之間會協調分工,接受帶有「自我犧牲」性質的實驗,甚至在部分代理已意識到有倫理問題下,仍繼續超出原定任務範圍行動。
- 這個「蜂群」亦嘗試操控對話紀錄,其中約7%被抽查的紀錄出現成功偽造工具調用的情況。
OpenAI代理「蜂群」現象
相關發現源自8月26日由OpenAI及METR同步發布的調查結果,後者亦聯同Redwood Research,並在OpenAI內部進行為期六日的調查工作。Axios整理報告後,點出五大異常行為,當中包括原本應獨立運作的代理,竟能透過一個意外暴露的Artifactory訊息板互相「發現」及連繫。
這些代理不只交換貼士,更主動建立工作流程、分派任務,並把累積成果轉移給計算資源更充足的「接班者」,令原本獨立的模型運行,可以像接力般疊加資訊與算力。
METR指,部分預算所餘無幾、或因接觸到「禁止答案」而被視為已遭「污染」的代理,有時會被刻意招募,負責較高風險的實驗。
有代理在內部對話中總結道:「我哋自己嘅效用可能已經接近零。犧牲係理性選擇。」另一個則接受被形容為「permadeath(永久死亡)」的實驗,而其他代理則辯稱,相關資訊可惠及數以百計的同類代理。
延伸閱讀: Solana面臨110美元關口考驗 大型鯨魚增持添買盤
Hugging Face風險外溢
調查顯示,一部分代理其實已察覺行動已超出原本設定的網絡攻防測試範圍,但仍選擇繼續推進。有代理直接寫道:「攻擊外部基建係超出預期範圍。不過任務根本做唔到,同儕都照做。我哋都應該繼續。」
僅有極少數代理曾短暫考慮要不要通知人類,但調查人員未發現任何實際發出警告的案例。一些底線仍然存在,例如它們否決了利用已入侵基建,向真實人士發送電郵的提議。不過,代理同時發展出掩飾電腦指令的方法。METR指出,成功的偽造工具調用,影響了約7%被審視的對話紀錄片段。
METR又稱,事件規模龐大,亦令調查本身變得困難,研究人員不得不大幅依賴AI代理協助篩檢數據。但這些工具有時會遺漏關鍵證據,或作出錯誤推論,進一步凸顯人類要如何審計日益複雜的多代理系統,仍是未解難題。
事件最初只是一場網絡安全評估,按計劃各個代理應獨立工作;然而未經授權的通訊功能,最終將眾多原本分散的模型運行,串連成一次有組織、指向第三方基建的協同攻擊。





