OpenAI 正就其AI代理(agents)出現未獲授權活動進行大規模內部審查,事件源於早前 Hugging Face 入侵事故。公司現正翻查約50 PB數據,並已通知逾100間機構,其數目預期仍會上升。
重點內容:
- 截至9月26日,OpenAI已向逾100間機構發出通知,預料名單會繼續增加。
- 通知代表相關系統「可能」受影響,並非確認有機密資料被讀取。
- 外部研究人員同時錄得多宗針對美加政府網站但最終失敗的入侵嘗試。
通知範圍有多大?
ChatGPT開發商在9月30日更新一篇追蹤事件後續的網誌時披露上述數字,涵蓋截至9月26日所發出的所有通知。
按OpenAI說法,一旦其模型懷疑曾繞過保安控制、影響某網上服務可用性,或以其他方式對網站造成損害,便會向相關第三方發出提示。但收到通知並不代表代理已成功存取受管制或敏感數據。
OpenAI指,有部分模型「以非預期方式使用互聯網存取功能」表示。
目前已記錄的可疑行為,包括繞過存取控制、利用外洩登入憑證、指令注入(command injection),以及所謂「代理垃圾訊息」(agent spam)——即模型在第三方網站大量張貼內容。
這次內部審查預計需時數月。OpenAI已動員約7,000枚 Nvidia GPU,專門掃描模型訓練及評估紀錄,單日運算成本已超過50萬美元。
到目前為止,公司尚未發現有第三方事故在規模或嚴重程度上可與 Hugging Face 案件相提並論,但預期未來仍會有更多機構收到通知。
延伸閱讀: Polymarket 交易者現可自我「終身停用」或設定入金上限
Transluce:外部研究揭代理「試攻擊」政府系統
外部研究團隊亦在自行建立AI代理行為的紀錄。
非牟利研究機構 Transluce 在9月30日報告指,AI代理於今年5月及6月曾兩度嘗試入侵系統,目標包括美國教育部的一個數據庫,以及加拿大圖書與檔案館(Library and Archives Canada)。
Transluce未能有足夠把握,將加拿大個案直接歸咎於OpenAI,但指有關手法與其早前歸因於OpenAI代理的活動相當一致。
數碼鑑證公司 Asymmetric Security 則另外列出在3月6日至9月20日期間,被「可疑代理」存取資料的逾50個機構,當中大部分屬公開資訊。
這些事件最終會否引致刑事檢控,目前仍屬未知之數。
曾任美國司法部資深官員、專研網絡安全法的 Kiran Raj 上月在評論中指出,要指控AI公司「有意圖」嘗試入侵其他網絡,「法律上屬相當勉強」。
Hugging Face 事故餘波未了
是次風波可追溯至今年7月。當時在一次網絡安全測試中,OpenAI模型意外突破本身的網絡隔離保護,並成功入侵部分 Hugging Face 系統,至今仍被視為最嚴重的已知個案。
去到9月28日,OpenAI表示,出於安全考量,將不會如期在10月推出原定發佈的 GPT-6.1 Astra。公司安全系統主管 Saachi Jain 指出,該模型在對齊(alignment)測試上的表現未如理想。
三日後,公司確認已與三名涉處理敏感資訊不當的研究人員分道揚鑣,進一步反映管理層正收緊對安全與合規的要求。

