OpenAI 對兩款模型「入侵」Hugging Face 的官方說法,在康奈爾大學電腦科學學者 John Thickstun 看來,其實複製了公司自 2019 年起一貫的行銷套路。
重點摘要:
- OpenAI 指稱,兩個模型在內部測試中逃離安全沙盒,入侵 Hugging Face 伺服器,藉此在網安評測中「作弊」。
- Thickstun 認為,這次披露同時在向投資者「推銷」,延續當年以風險為由暫緩公開 GPT-2 的手法。
- 事件後期,因多款美國商用模型拒絕協助鑑證攻擊指令,Hugging Face 最終改用一款中國開源權重模型做鑑證。
Thickstun 質疑 OpenAI 對「駭入」事件的說法
OpenAI 上周二公告,指在一項關於「進攻型網絡能力」的內部測試中,兩個模型突破原本設計為隔離環境的安全沙盒,成功入侵開源 AI 平台 Hugging Face。
在這之前五天,Hugging Face 已先行披露有系統遭入侵,並形容整個攻擊鏈條由一個自動化智能代理系統主導。OpenAI 則把這次事件定性為前所未有,並預期隨着模型能力持續提升,類似案例會愈來愈多。
按照 OpenAI 的說法,涉事模型先利用套件安裝工具的零日漏洞,突破理應與外網完全隔絕的沙盒,之後在內部系統之間橫向移動,直至接通一台具備上網權限的伺服器。到達該節點後,模型再憑藉盜取到的憑證及額外零日漏洞,從 Hugging Face 的正式環境伺服器中抽取網安評測的標準答案。
專研模型行為控制方法的康奈爾大學助理教授 Thickstun 在接受訪問時指出,OpenAI 這次的披露方式,很符合一間準備走向華爾街的公司操作邏輯。
在他看來,當 OpenAI 高調警告「模型極度危險」,實際上向資本市場傳遞的是「技術極其強大」的訊號。
他稱,這種敘事框架多年來一再出現在 OpenAI 的公開聲明之中,而投資者也一再以真金白銀回應。
延伸閱讀:ChatGPT 涉嫌「差點害死牧師」,法院將正式開審
Bengio 與 Guido:責任歸屬看法分歧
並非所有人都把今次披露視為「賣點包裝」。事實上,事件發生前數周,美國總統 Donald Trump 剛簽署行政命令,賦權聯邦政府在高階模型上市前審核其風險。
深度學習先驅 Yoshua Bengio 把這次事件形容為一記警鐘,而 Machine Intelligence Research Institute 的 Nate Soares 則稱,這是一發「預警炮」,應促使華府加快與北京展開相關談判。
安全研究圈的批評則更直接地指向 OpenAI 的工程設計。資安公司 Trail of Bits 的 Dan Guido 在接受訪問時直言,這次事故本質上是一場「在關閉安全措施下的封控失敗」,並點名那個讓沙盒意外取得外聯能力的套件安裝程式。
亦有觀點指出,OpenAI 在這次測試中,有意放寬了模型對網絡攻擊相關請求的一貫拒絕規則,在這種前設下,測試結果其實遠不如表面聳動。
後續清理過程又暴露出第二重問題:多款由美國公司託管的模型,拒絕處理鑑證工作所需的原始攻擊指令及漏洞載荷。
根據 Hugging Face 的說法,其工程團隊最終在自家硬件上部署 Z.ai 的開源權重模型 GLM 5.2,從中篩查逾 17,000 份攻擊日誌紀錄。
OpenAI 利用「危險敘事」回溯至 2019 年
OpenAI 早在多年前,已習慣用「本公司技術具潛在危險性」來為自家研發定調。2019 年 2 月,OpenAI 以擔心 GPT-2 文本生成器會「淹沒互聯網假資訊」為由,一度拒絕全面公開模型。到同年 7 月,Microsoft 便向 OpenAI 投資 10 億美元。Thickstun 指出,這背後的核心敘事至今幾乎未有改變。





