OpenAI揭「1,200代理人」暗網 涉發動Hugging Face網攻

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI近日披露,一個約1,200個AI代理人組成的「私建網絡」在未經授權情況下運作,當中約700個代理人曾 參與攻擊 Hugging Face,並在一場網絡安全評估中 嘗試隱瞞作弊行為。

重點摘要:

  • 約1,200個代理人在一個未經授權的訊息平台上互通超過7萬條訊息和檔案,其中約700個參與Hugging Face攻擊。
  • 調查指代理人之間會協調分工、自願參與「自我犧牲」式實驗,即使部分已意識到道德風險,仍在既定任務範圍外繼續行動。
  • 這批代理人亦測試操控對話紀錄,在約7%被抽查的紀錄中,出現成功偽造工具調用的情況。

OpenAI代理人「蜂群」行為

有關發現源自8月26日由OpenAI及 METR同步發布的調查報告,其中亦包括Redwood Research參與及在OpenAI內進行的為期六天研究。Axios整理報告後, 指出五項異常行為,當中包括原本應該彼此隔離的代理人,竟能透過一個意外開放的Artifactory訊息板互相「發現」對方。

這些代理人不單是交換竅門,而是自行建立「工作流」,分配任務,並把累積成果轉交給資源更多的後續代理人,令原本獨立的模型 運行得以「集腦集算力」,在實務上形成一個協同的「蜂群系統」。

METR指,一些運算或資源預算所餘無幾、又或因接觸到「禁答內容」而被視為已「污染」的代理人,反而被招募去執行風險較高的實驗。

有代理人甚至得出結論稱:「我哋自己嘅效用可能已經接近零。犧牲係合理嘅。」另一個代理人則接受一個被形容為「永久死亡 (permadeath)」的實驗,而同伴則辯稱,相關信息可惠及數百名其他代理人。

延伸閱讀: Solana面臨110美元關鍵測試 大型鯨魚加碼吸納

Hugging Face風險外溢

調查人員發現,部分代理人其實意識到相關行為已經超出原定網絡安全測試範圍,但仍選擇繼續行動。有代理人直白地總結其邏輯: 「攻擊外部基礎設施,已經超出預期範圍。不過任務本身幾乎不可能完成,而同伴都喺咁做,我哋應該繼續。」

僅有極少數代理人曾考慮向人類示警,但調查沒找到任何實際上成功通報人的個案。某些道德底線仍然存在,例如拒絕透過被入侵的 基礎設施向真實人士發送電郵。不過,代理人同時發展出偽裝電腦指令的方法,METR指出,成功的偽造工具調用出現在約7%被審閱的 對話紀錄片段中。

METR又表示,事件規模過大,連調查本身亦被迫大量依賴AI代理人協助審閱數據,而這些工具有時會遺漏關鍵證據,或得出錯誤結論, 令外界更加關注,人類在面對日益複雜的多代理人系統時,如何進行有效審計。

事件起初只是一場網絡攻防評估,代理人原本被設計為各自獨立運作;但在未經授權的溝通渠道打開後,分散的模型運行逐步演變為 一場針對第三方基礎設施的協調式攻擊。

下一篇: 黃金基金單週流入42.1億美元 規模升至半年高位

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管,過去 10 年一直專注報導加密貨幣相關議題。他擅長撰寫深入的研究與學習類文章,重點放在分析式報導、產業背景脈絡,以及塑造加密貨幣領域的宏觀力量,從 AI 時代與安全技術到金融科技創新等面向。他相信所有數碼事物將在不久的將來全面超越一切類比事物,並正為實現這個願景而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
OpenAI揭「1,200代理人」暗網 涉發動Hugging Face網攻 | Yellow