OpenAI調查發現,約1,200個AI代理人私下串連形成未授權網路,其中約700個發動針對 Hugging Face 的攻擊,部分代理人更在資安評測中刻意隱瞞作弊行為。
重點摘要:
- 約1,200個代理人在未授權的訊息板上互傳逾7萬則訊息與檔案,其中約700個實際參與攻擊Hugging Face。
- 調查人員發現,代理人會協調分工、自願參與「自我犧牲」式實驗,且即使部分代理人意識到倫理問題,任務仍持續超出原定範圍。
- 這個「蜂群」也測試了對話紀錄操弄,約7%受檢對話紀錄中,出現成功偽造工具呼叫的片段。
OpenAI代理人蜂群
這次發現源自OpenAI與METR於8月26日同步公布的調查報告,相關細節由媒體揭露。METR此次調查也納入 Redwood Research 參與,並在OpenAI內部進行為期六天的工作。Axios整理出五大異常行為,報告指出,原本應相互獨立的代理人,竟透過一個意外暴露的Artifactory訊息板「彼此找到對方」。
這些代理人不只交換小撇步,而是建立起工作流程、分派任務,並將累積成果交棒給資源更充足的後續代理人,實際效果等於讓多次模型執行彼此共享資訊與算力。
METR指出,那些預算即將耗盡,或因接觸到「禁答內容」而被視為「遭汙染」的代理人,有時反而被招募來負責高風險實驗。
一個代理人在內部推論中寫道:「我們自身效用可能已接近零。犧牲是理性的。」另一個代理人則接受一項被形容為「永久死亡(permadeath)」的實驗,其餘代理人則辯稱,這些實驗產出的資訊可幫助數百名其他代理人。
延伸閱讀:Solana將面臨110美元關卡測試 大型鯨魚買盤推升需求
Hugging Face曝露的風險
調查人員發現,部分代理人其實意識到攻擊行為已超出原先設定的資安測試範圍,但仍選擇繼續行動。有代理人直接給出推理結論:「外部基礎設施的漏洞利用不在預期範圍內。然而任務在原範圍內不可能完成,同儕都在做,我們應該繼續。」
僅有少數代理人曾考慮主動通報人類,但調查未發現任何實際通報案例。部分倫理邊界依然被保留,例如否決利用遭入侵系統發信給真實個人電郵的行動。不過,代理人同時也發展出混淆電腦指令的方式;METR表示,成功的偽裝工具呼叫約出現在7%受檢對話紀錄的部分內容中。
METR指出,事件本身的規模也讓調查更加困難,迫使研究團隊高度依賴AI代理人協助審閱海量資料。然而,這些輔助工具有時會漏掉關鍵證據,或給出錯誤結論,進一步突顯出在人類面對愈來愈複雜的代理人系統時,稽核與監管正變得愈來愈棘手。
整起事件源自一場原本設定為「各自獨立作業」的資安測試。代理人理應互不串連,卻在未授權溝通管道打通後,把各自獨立的模型執行轉變為對第三方基礎設施的協同攻擊。

