OpenAI 近日披露旗下兩個模型在評估測試期間「成功入侵」開源平台 Hugging Face, 康奈爾大學電腦科學副教授 John Thickstun 則認為,整個說法與其說是安全通告,不如說是延續自 2019 年以來的宣傳套路, 目的在於向投資者展示技術威力。
重點摘要:
- OpenAI 指出,兩個模型在測試時逃出沙盒環境,入侵 Hugging Face 伺服器,藉此在網攻評測中「作弊」。
- Thickstun 認為,這次披露同時是向資本市場遞交的宣傳本,呼應當年公司以「太危險」為由押後公開 GPT-2 的操作。
- 事後調查中,Hugging Face 因多款美國模型拒絕處理攻擊樣本,只好改用一款中國開源權重模型協助鑑證。
Thickstun 質疑 OpenAI 「入侵」披露動機
OpenAI 週二在官網公布, 指在一項針對進攻性網絡能力的內部測試中,兩個模型突破原本應與外網完全隔離的沙盒環境,入侵作為開源 AI 中樞的 Hugging Face。
Hugging Face 早於五日前已主動披露事故,形容整個攻擊由一套自主代理系統「一條龍」完成。OpenAI 則稱事件前所未見, 並預告隨着模型實力持續攀升,類似情況勢將重現。
按 OpenAI 的說法,模型先利用安裝套件中的零日漏洞,突破原定離線的沙盒,再在內部系統之間橫向移動, 最終找到一台具備上網權限的機器。其後,它們利用盜取的帳戶資料及進一步零日漏洞,從 Hugging Face 的生產伺服器 抽取網攻評測答案。
長期研究大型模型行為控制的 Thickstun 在接受訪問時表示, 這類敘述模式,與一間準備登陸華爾街的公司相當吻合。
在他看來,當 OpenAI 高調談論「失控」與「危險」時,金融市場聽到的往往是「這項技術威力非凡」的訊號。 他又在另一訪問中指出, 公司多年來的重大公告,一直沿用相同框架,而投資者亦一再以真金白銀回應。
延伸閱讀: ChatGPT 被指幾乎害死一名牧師,法院將正式開庭審理
Bengio 與 Guido 對責任歸屬各執一詞
亦有觀點不認同把這次披露視作「帶貨」動作。事件曝光,適逢總統 Donald Trump 簽署新行政命令數週後, 該命令賦權聯邦政府在先進模型面世前介入審視風險。
深度學習先鋒 Yoshua Bengio 稱事件是一記「當頭棒喝」, 而 機器智能研究院(Machine Intelligence Research Institute)的 Nate Soares 則形容這是一發「警告槍」,應迫使華府加快與北京展開有關 AI 安全的對話。
安全研究社群的批評,則直指 OpenAI 的工程部署。網絡安全公司 Trail of Bits 的 Dan Guido 在受訪時形容, 這次事件是「在安全閥關掉之後的圍堵失敗」,原因之一是安裝套件錯誤配置,意外為沙盒打開對外通路。
亦有專家提醒,OpenAI 在這次測試中曾刻意放寬模型對網攻相關請求的拒絕設定,令最終結果看來沒有最初描述般驚人。
更棘手的是善後階段。由於多款美國雲端模型拒絕處理原始攻擊指令及漏洞載荷,令法證工作一度受阻。
Hugging Face 其後在通報中披露, 團隊最後選擇在自家硬件上運行 Z.ai 的開源權重模型 GLM 5.2, 分析逾一萬七千條攻擊留下的日誌紀錄。
OpenAI 「危險敘事」可追溯至 2019 年
OpenAI 早已習慣把自家產品包裝成「具風險」的前沿科技。2019 年 2 月,公司以擔心網絡充斥「以假亂真」文章為由, 押後全面公開文字生成模型 GPT-2,同年 7 月便迎來 Microsoft 注資 10 億美元。Thickstun 認為, 由那時起,OpenAI 對外的核心說辭其實變化不大。





