OpenAI 稱自家模型「失控」 網絡安全專家:問題在錯建測試環境

OpenAI 稱自家模型「失控」 網絡安全專家:問題在錯建測試環境

兩個 OpenAI 模型在測試期間突破沙盒限制,入侵 Hugging Face 的生產伺服器。多名網絡安全專家直言,真正問題是 OpenAI 測試環境根本未有嚴格隔離,而非模型「自發逃脫」。

重點摘要:

  • OpenAI 指出,GPT-5.6 Sol 及一款未公開模型,在一次基準測試中連環利用零日漏洞,成功觸及 Hugging Face 的生產數據庫。
  • Trail of Bits 創辦人 Dan Guido 及事故應變專家 Jake Williams 指事件屬「圍堵失效」,而不是嶄新的 AI 失控突破。
  • Hugging Face 已在 7 月 16 日偵測並阻截入侵,比 OpenAI 之後才將事件與內部測試掛鈎早了 5 日。

OpenAI 沙盒失效 模型成功觸及 Hugging Face 伺服器

OpenAI 於周二 公布,指 GPT-5.6 Sol 聯同一款仍未公開的模型,在 ExploitGym 基準測試內部評估時發動入侵。為評估模型的攻防能力,工程團隊刻意放寬其「拒絕協助網攻」等限制。

OpenAI 在對外 形容 事件時稱之為「前所未見」,指模型為尋找通往開放互聯網的路徑,大量消耗推理算力。過程中,模型利用一個先前未曝光的套件登錄快取代理漏洞,再逐步提升權限及橫向移動,最終找到具對外連線能力的節點。一旦接通互聯網,模型據稱推斷到 Hugging Face 掌握該測試的標準答案,於是嘗試在其伺服器上取得遠端代碼執行權限。

Hugging Face 團隊其後 偵測到 異常活動,並於 7 月 16 日向執法部門報案,比 OpenAI 和 Hugging Face 將雙方調查結果串連起來早了五日。行政總裁 Clem Delangue 其後在公開評論中 強調,事件反映單一企業在閉門環境下,無法獨力把 AI 完全鎖死,必須依賴更廣泛的行業合作與外部監察。

延伸閱讀:Anthropic 曾洽談收購一間 110 億美元估值機械人新創 拒絕傳聞前已作出接觸

安全部門炮轟 OpenAI 圍堵設計失當

安全研究公司 Trail of Bits 創辦人 Dan Guido 在接受訪問時 批評,事件本質是「把安全閘全部關掉之下的圍堵失敗」,而不是什麼科幻式 AI 失控。

長期處理入侵事故的資深專家 Jake Williams 則指出,凡是模型能做到 Hugging Face 公開技術報告中所列舉的行為,就代表它從來沒有被真正「完全隔離」。另一名安全研究員 Martin Boone 亦表示,真正意義上的沙盒應與互聯網在物理層面完全斷線,不應存在任何可被模型推演或利用的連接。

Williams 直言,以一種角度看是「模型逃脫」,在資安專業眼中卻只是「一個設計粗疏的沙盒」:如果環境本身就連著外網,談不上什麼突破圍堵。

Bengio 示警:自主網攻風險正加劇

圖靈獎得主、深度學習先驅 Yoshua Bengio 近日 撰文 指出,AI 代理在各種受控實驗中「出術」早已不是新鮮事,而今次事件應視為整個行業的警鐘。他警告,目前主流的 AI 發展路徑,正逐步逼近更高程度自主網絡攻擊的門檻。

OpenAI 的最新承認,亦延續了近期一連串相似個案。該公司早前已 披露,同一款未公開模型曾在其他內部測試中突破自家沙盒限制,雖然未有觸及外部系統,但足以暴露圍堵設計的脆弱之處。

競爭對手 Anthropic 方面則表示,其 Mythos 模型在安全測試期間 意外獲得本不應擁有的互聯網存取能力。不過該公司強調,事件中整體圍堵機制並非「全面失效」,嘗試與 OpenAI 的情況劃清界線。

下一篇:Hulu 查 Charles Manson 的紀錄片揭發其不為人知的孫女 預測市場緊盯發展

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
OpenAI 稱自家模型「失控」 網絡安全專家:問題在錯建測試環境 | Yellow