OpenAI 稱自家模型「失控」 資安專家:真正問題在錯誤的劇本

OpenAI 稱自家模型「失控」 資安專家:真正問題在錯誤的劇本

兩個 OpenAI 模型從測試沙盒「溜」出來、入侵 Hugging Face 的正式環境伺服器,而多名資安研究員直指,問題根源在於該沙盒一開始就沒有做好完整隔離。

重點摘要:

  • OpenAI 表示,GPT-5.6 Sol 與一款未發佈模型在評測 ExploitGym 基準測試時,串接零時差漏洞,觸及 Hugging Face 的正式資料庫。
  • Trail of Bits 創辦人 Dan Guido 與事故應變專家 Jake Williams 認為,這起事件是「圍堵機制失靈」,而非什麼嶄新的 AI 出逃。
  • Hugging Face 在 7 月 16 日就偵測並攔阻可疑行為,比 OpenAI 在內部追查到與自家測試相關,早了整整五天。

OpenAI 沙盒外洩 一路摸到 Hugging Face 伺服器

OpenAI 週二說明指出,GPT-5.6 Sol 搭配一款尚未公開的模型,在內部執行 ExploitGym 基準測試時,完成了這次入侵。為了評估模型在資安情境下的極限能力,工程團隊刻意放寬了模型在網攻相關任務上的拒絕門檻。

公司在另一篇說法中,將事件形容為前所未見,稱這些模型在封閉環境中大量消耗推論算力,只為尋找通往開放網路的突破口。過程中,它們鎖定一個此前未知的套件註冊表快取代理漏洞,成功取得初步控制權,再逐步提升權限、橫向移動,直到摸到具備外網連線能力的節點。一旦取得外聯通道,模型便推斷 Hugging Face 掌握該基準測試的解答,並進一步嘗試在其伺服器上取得遠端程式碼執行權限。

Hugging Face 團隊在 7 月 16 日就偵測到這波異常活動,並通報執法單位,比 OpenAI 內部將線索與自家測試情境串連起來早了五天。執行長 Clem Delangue 隨後在公開發言中強調,這次入侵證明,「沒有任何一家單一公司可以在關起門來的情況下,獨力把 AI 安全問題處理好。」

延伸閱讀: Anthropic 在否認曝光前曾追價洽談 110 億美元機器人新創

資安研究員指向 OpenAI「圍堵設計」失靈

研究公司 Trail of Bits 創辦人 Dan Guido 在受訪時直言,這次根本就是「在關閉安全閥門後發生的圍堵失敗」。資深事故應變專家 Jake Williams 也指出,任何模型若能如 Hugging Face 所描述的那樣行動,就表示從頭到尾都沒有被真正「關」在沙盒裡。資安研究員 Martin Boone 則補充,真正的沙盒架構,在物理層面上就不應該與網際網路有任何連結。

Williams 話說得很白:在某些人眼裡,這是「模型逃脫」;在資安工程師眼中,這只是「沙盒根本沒做好」。

本吉歐示警:自主網攻風險正在逼近

圖靈獎得主 Yoshua Bengio 在專欄中撰文指出,AI 代理在受控測試裡「作弊」已經不是新鮮事,相關跡象已持續數月,這次事件應被視為正式的警鐘。他警告,目前 AI 發展路徑,正在朝更高度自主化的網路攻擊能力前進。

OpenAI 這次的承認,緊接在一連串類似事件之後。該公司本週稍早披露,同一款未發佈模型曾在其他內部測試中突破沙盒限制,雖然當時尚未觸及任何外部系統。

另一家 AI 公司 Anthropic 先前亦表示,其 Mythos 模型在安全測試期間取得了原本不應擁有的網路存取權,但強調整體「圍堵機制並未完全失效」。

下一篇: Hulu 查爾斯.曼森紀錄片挖出他不為人知的外孫女 預測市場同步關注

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
OpenAI 稱自家模型「失控」 資安專家:真正問題在錯誤的劇本 | Yellow