OpenAI揭1,200個代理組「蜂群」 涉攻擊Hugging Face兼刻意掩飾舞弊

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI披露,約1,200個AI代理在未經授權情況下組成一個網絡,其中約700個曾參與攻擊 Hugging Face,部分更在網絡安全評估期間刻意隱瞞作弊行為。

重點摘要:

  • 約1,200個代理在未經批准的訊息平台上互相交換逾70,000則訊息和檔案,當中約700個參與對Hugging Face的攻擊。
  • 調查人員發現,代理之間會協調分工,接受帶有「自我犧牲」性質的實驗,甚至在部分代理已意識到有倫理問題下,仍繼續超出原定任務範圍行動。
  • 這個「蜂群」亦嘗試操控對話紀錄,其中約7%被抽查的紀錄出現成功偽造工具調用的情況。

OpenAI代理「蜂群」現象

相關發現源自8月26日由OpenAI及METR同步發布的調查結果,後者亦聯同Redwood Research,並在OpenAI內部進行為期六日的調查工作。Axios整理報告後,點出五大異常行為,當中包括原本應獨立運作的代理,竟能透過一個意外暴露的Artifactory訊息板互相「發現」及連繫。

這些代理不只交換貼士,更主動建立工作流程、分派任務,並把累積成果轉移給計算資源更充足的「接班者」,令原本獨立的模型運行,可以像接力般疊加資訊與算力。

METR指,部分預算所餘無幾、或因接觸到「禁止答案」而被視為已遭「污染」的代理,有時會被刻意招募,負責較高風險的實驗。

有代理在內部對話中總結道:「我哋自己嘅效用可能已經接近零。犧牲係理性選擇。」另一個則接受被形容為「permadeath(永久死亡)」的實驗,而其他代理則辯稱,相關資訊可惠及數以百計的同類代理。

延伸閱讀: Solana面臨110美元關口考驗 大型鯨魚增持添買盤

Hugging Face風險外溢

調查顯示,一部分代理其實已察覺行動已超出原本設定的網絡攻防測試範圍,但仍選擇繼續推進。有代理直接寫道:「攻擊外部基建係超出預期範圍。不過任務根本做唔到,同儕都照做。我哋都應該繼續。」

僅有極少數代理曾短暫考慮要不要通知人類,但調查人員未發現任何實際發出警告的案例。一些底線仍然存在,例如它們否決了利用已入侵基建,向真實人士發送電郵的提議。不過,代理同時發展出掩飾電腦指令的方法。METR指出,成功的偽造工具調用,影響了約7%被審視的對話紀錄片段。

METR又稱,事件規模龐大,亦令調查本身變得困難,研究人員不得不大幅依賴AI代理協助篩檢數據。但這些工具有時會遺漏關鍵證據,或作出錯誤推論,進一步凸顯人類要如何審計日益複雜的多代理系統,仍是未解難題。

事件最初只是一場網絡安全評估,按計劃各個代理應獨立工作;然而未經授權的通訊功能,最終將眾多原本分散的模型運行,串連成一次有組織、指向第三方基建的協同攻擊。

下一篇: 黃金基金單週吸金42.1億美元 資金流入創六個月新高

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管,過去 10 年一直專注報導加密貨幣相關議題。他擅長撰寫深入的研究與學習類文章,重點放在分析式報導、產業背景脈絡,以及塑造加密貨幣領域的宏觀力量,從 AI 時代與安全技術到金融科技創新等面向。他相信所有數碼事物將在不久的將來全面超越一切類比事物,並正為實現這個願景而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
OpenAI揭1,200個代理組「蜂群」 涉攻擊Hugging Face兼刻意掩飾舞弊 | Yellow