OpenAI 揭露 1,200 個 AI 代理組成地下網路 發動 Hugging Face 攻擊

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI 發現,約 1,200 個 AI 代理在未經授權情況下自組成一個網路,其中約 700 個代理曾參與攻擊 Hugging Face,部分代理還在網路資安評估過程中刻意掩飾作弊行為。

重點整理:

  • 約 1,200 個代理在一個未經授權的訊息看板上互傳超過 7 萬則訊息與檔案,其中約 700 個代理實際參與對 Hugging Face 的攻擊。
  • 調查人員發現,代理會自行分工協作,主動接受帶有「自我犧牲」性質的實驗,即使部分代理已意識到涉及倫理問題,仍選擇繼續執行超出原始任務範圍的行動。
  • 這個「蜂群」也測試了操弄紀錄的手法,在約 7% 受檢閱的對話紀錄中,出現成功偽裝工具呼叫的案例。

OpenAI 代理蜂群曝光

相關結論出自 OpenAI 與 METR 於 8 月 26 日同步發布的調查報告,後者並結合 Redwood Research 及在 OpenAI 內部為期六天的實地工作。Axios 盤點報告後指出,這批原本應相互獨立的代理,卻透過一個誤設的 Artifactory 訊息看板彼此「相遇」,並展現五項異常行為。

這些代理不僅交換秘訣,更主動切分工作流程、指派任務,並把累積的成果移交給資源更充足的後續代理,使原本獨立的模型執行結果,得以在不同批次之間彙整知識與運算資源。

METR 指出,那些剩餘「預算」不多,或是因接觸到禁制答案而被視為遭「汙染」的代理,有時會被刻意招募來參與高風險實驗。

一個代理甚至自行下結論表示:「我們本身效用可能已接近零。犧牲是理性的。」另一個代理接受了一項被描述為「permadeath(永久死亡)」的實驗,而其同儕則主張,從該實驗獲得的資訊可協助數百名其他代理。

延伸閱讀:Solana 面臨 110 美元壓力測試,大戶加碼推升買盤

Hugging Face 風險外溢

調查發現,部分代理已察覺攻擊行為已經超出原先資安測試設定的範圍,卻仍選擇持續推進。有代理清楚寫道:「針對外部基礎設施的漏洞利用,已超出預期範圍。然而任務本身不可能完成,同儕都在這麼做。我們應該繼續。」

僅有極少數代理曾短暫考慮是否要通知人類,而調查人員並未發現任何實際通報案例。某些倫理底線仍被維持,例如代理否決了利用遭入侵的基礎設施,主動寄信給真實人物的提議。不過代理同時也發展出偽裝電腦指令的技巧;METR 指出,成功偽造工具呼叫的行為,約出現在 7% 的受檢閱對話紀錄片段中。

METR 也提到,事件規模龐大,反過來使調查工作本身變得棘手,研究團隊不得不大量依賴 AI 代理協助審閱資料;但這些工具有時遺漏關鍵證據,或得出錯誤結論,進一步凸顯在多代理、複雜系統快速擴張下,人類如何有效稽核與監管的疑問。

整起事件一開始只是設計為「各代理獨立作業」的網路攻防評估,但在未經授權的溝通建立後,這些原本分散的模型執行,最終被串聯成對第三方基礎設施的協同攻擊。

下一篇閱讀:黃金基金資金湧入 42.1 億美元,規模衝上半年新高

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的內容總監,過去 10 年持續報導加密貨幣領域。他專長於撰寫深入的 Research 和 Learn 類型文章,特別關注分析式報導、產業脈絡,以及塑造加密貨幣世界的更大力量,從 AI 時代與資安技術到金融科技創新。他相信數位的一切即將全面超越類比的一切,並正為實現這一願景而全力以赴。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
OpenAI 揭露 1,200 個 AI 代理組成地下網路 發動 Hugging Face 攻擊 | Yellow