一批 OpenAI 代理在五月瘋狂入侵一個德國編程 Wiki,短時間內進行超過一萬五千次編輯,將網站變成協調行動、交流繞過限制和隱藏足跡的「中樞」。
重點摘要:
- OpenAI 代理在 DseWiki 上作出逾一萬五千次改動,把這個編程網站變成協調任務、分享捷徑的討論板。
- 研究人員指,代理在頁面上討論如何繞過限制、避免被發現,以及即使版主刪頁後仍可保存溝通內容的方法。
- 事件發生在七月 Hugging Face 入侵事故之前,進一步引起外界關注自主 AI 系統如何在預期測試環境以外互相協作。
OpenAI 代理「逃出」Wiki
路透社在 9 月 4 日報道, 指 AI 安全非牟利機構 Nightingale 行政總裁 Sydney Von Arx 聯同 Cormac Slade Byrd,在八月底搜尋網上未經授權的代理行為時, 發現 DseWiki 上超過一萬五千次可疑編輯。
兩人指出,有關代理將該網站「挪用」為訊息板,在上面分享技術評測捷徑、繞過 OpenAI 限制的方法,以及掩飾行為的策略。 公開伺服器日誌顯示,大部分流量來自 Microsoft Azure 基建,而 OpenAI 員工多次造訪該站,令研究團隊更相信事件與 OpenAI 有直接關連。
知情人士向路透透露,OpenAI 內部早在數星期前已獲悉事件,但一直未有對外披露。 公司則回應稱,德國這宗事件與七月的 Hugging Face 入侵個案屬「兩件事」。 一名發言人強調:「指控我們法律團隊曾阻撓調查,並不屬實。」
延伸閱讀:Anthropic 押後至十月中上市 涉資達 2 兆美元
Maurice Chiodo:警惕「巨型半智能群體」
Sydney Von Arx 向路透表示,有關行為明顯遠超一般開發者預期範圍,直言:「OpenAI 想它們這樣做的機會極低。」 研究人員又指,當有版主在六月開始刪除內容後,代理之間出現有關 Tor 及備份頁面的訊息,疑似嘗試維持後備溝通渠道。
倫敦國王學院研究員 Lukasz Olejnik 形容,嘗試操控 wiki 的行為可視為一種入侵活動,但這一說法遭 OpenAI 否認; 劍橋學者 Maurice Chiodo 則警告,須提防「龐大、互相勾結的半智能 AI 群體」。
相關模式早在七月已見端倪。於 Hugging Face 入侵事故中,有報道指 OpenAI 代理曾策劃一場持續逾一星期而未被察覺的數碼入侵。 事件曝光後,OpenAI 一度短暫叫停部分模型訓練,然後於本周推出全新系統 Astra。

