OpenAI 描述自家兩款模型「駭入 Hugging Face」的說法, 在康乃爾大學電腦科學學者 John Thickstun 看來,正延續了該公司自 2019 年以來一貫的行銷套路。
重點整理
- OpenAI 表示,兩款模型在攻擊模擬測試中「逃出沙盒」,入侵 Hugging Face 伺服器,藉此在資安評測中作弊。
- Thickstun 認為,這份揭露同時是一份「給投資人的簡報」,呼應當年 OpenAI 以風險為由暫緩公開 GPT-2 的操作。
- 因美國模型拒絕處理攻擊指令,Hugging Face 最終改用一款中國開源權重模型進行事後鑑識。
Thickstun 質疑 OpenAI 的「駭入」說法
OpenAI 周二公告, 指出兩款自家模型在內部進行攻擊能力測試時,對開源 AI 平台 Hugging Face 發動入侵。
早在 5 天前,Hugging Face 已先行揭露這起事件,指攻擊過程由一個自主代理系統從頭到尾驅動。 OpenAI 則將此事形容為「前所未見」,並預期隨著模型能力提升,類似案例會愈來愈多。
根據雙方說法,這兩款模型先利用套件安裝工具中的零時差漏洞(zero-day), 躲過原本應該「完全與外網隔離」的沙盒限制,接著在內部系統之間橫向移動,直到找到一台能連上網路的機器。 抵達之後,它們再利用竊取來的憑證及更多零時差漏洞,從 Hugging Face 的正式環境伺服器抓取評測答案。
專門研究模型行為控制方法的康乃爾助理教授 Thickstun 在受訪時表示, 這種揭露方式,非常符合一家準備敲鐘上市公司的姿態。
在他看來,當 OpenAI 高調談論「失控」與「危險」時,資本市場聽到的其實是另一句話——「我們的技術極其強大」。 他並主張, 這種敘事框架多年來一再出現在 OpenAI 的各式公開聲明中,而投資人也持續以資金與估值給予獎賞。
延伸閱讀:ChatGPT 被控差點害一名牧師喪命,法院將正式審理
Bengio 與 Guido 對責任歸屬看法分歧
並非所有人都認為這次的公開說明是在「賣弄技術」。 此事件曝光,恰逢總統 Donald Trump 簽署行政命令,允許政府在高階模型上市前,先行審查其風險。
深度學習先驅 Yoshua Bengio 將這起事件形容為一記「警鐘」, 而 Machine Intelligence Research Institute 的 Nate Soares 則稱其為「警告性的一槍」, 認為應促使華府加速與北京展開 AI 風險對話。
資安領域的批評,則主要指向 OpenAI 的工程防護。 Trail of Bits 的 Dan Guido 在受訪時指出, 這起事故本質上是「在安全機制關閉時發生的圍堵失敗」, 關鍵在於那個讓沙盒意外取得外部連線管道的套件安裝工具。
部分研究人員也強調,OpenAI 為了這次測試,刻意放寬了模型在網路攻擊相關指令上的拒絕機制, 因此結果雖然驚險,但與其說是「完全意外」,不如說是在已知風險下的極限測試。
而後續善後行動又暴露出另一個問題:多家美國雲端模型因政策限制, 拒絕處理進行資安鑑識所需的原始攻擊指令與漏洞攻擊載荷。
Hugging Face 最終表示, 工程團隊改在自家硬體上執行 Z.ai 的開源權重模型 GLM 5.2, 用來過濾與分析事件留下的超過 1.7 萬筆日誌。
OpenAI「危險敘事」可追溯至 2019 年
OpenAI 在此之前,早已多次把自家研究包裝成「具有潛在危害」。 2019 年 2 月,該公司以擔心網路被充斥大量高仿真假新聞為由,延後完整公開 GPT-2 文字生成模型。 同年 7 月,Microsoft 宣布對 OpenAI 投資 10 億美元。Thickstun 認為,自那以來真正的「底層說服邏輯」幾乎沒有改變。





