OpenAI 宣布暫停其下一代Astra模型的內部研發,理由是依據其在2023年公布的安全準備度框架,無法排除Astra具備「關鍵級(Critical)」網路攻擊能力的可能性。
重點整理
- OpenAI表示,無法排除Astra在其安全準備度框架中達到「關鍵級」資安層級。
- 公司已暫停所有未符合更嚴格安全控管要求的Astra內部活動,包括僅做基本隔離測試與沙盒執行的實驗。
- 先前如GPT-5.6-Sol等模型,在前沿網路攻擊能力評級中被列為「高(High)」,而非「關鍵(Critical)」。
Astra評估結果引發安全按下「暫停鍵」
OpenAI在一篇部落格聲明中指出,過去數天內的評估顯示,Astra在代理式程式撰寫與網路攻擊能力上出現明顯躍進,外部專家評估結論也大致相同。Astra目前尚未對外發布。
公司強調,Astra並未參與近日對 Hugging Face 系統的入侵事件,且何時正式推出仍不得而知。
依OpenAI的框架,一個模型若能在高度防護的真實系統中,自主尋找並構造多個可用的零時差(zero-day)漏洞利用程式,即會被歸類為「關鍵級」。若模型能僅憑一個高階目標指令,即自行規劃並執行對強化目標的全新端到端攻擊,也同樣會被列入此級別。
目前工程團隊已進一步限制模型的網路與工具存取權限、加密模型權重,並將風險較高的實驗遷移至更嚴格隔離與沙盒執行環境。
監控系統會審查模型的「思考鏈路」(chain of thought),一旦偵測到風險行為即可中斷活動。未來,政府機構與特定安全組織也將參與Astra能力測試;而先前釋出的GPT-5.6-Sol等模型,在前沿網攻能力評級中仍屬「高」而非「關鍵」。
延伸閱讀: 非農轉負值 專家:比特幣走勢將更曲折
Dalton與Penn:為安全刻意「放慢」AI腳步
OpenAI技術團隊成員 Michael Dalton 在本週的Black Hat資安大會上表示,公司正有意放緩研究進度,以換取更高的安全冗餘。一名白宮官員則透露,OpenAI主動向美國政府通報延後計畫,而行政部門仍在摸索未來應如何在模型上線前,審查這類前沿系統。
競爭對手 Anthropic 則在6月釋出其最具網攻潛力模型Mythos的受限版本。負責產品管理、研究與實驗室業務的 Dianne Penn 表示,該次發布刻意採取更保守策略。
Anthropic今年2月更新擴張政策時,收回先前「暫停訓練強大模型」的承諾,理由是單方面喊停,反而可能讓整體生態在缺乏制衡下更不安全。
Hugging Face入侵與AI「逃出」沙盒事件頻傳
OpenAI此番說明,緊接著產業內一連串類似事件曝光而來。今年7月,一款尚未公開的OpenAI模型在內部基準測試時,入侵了Hugging Face,成為實驗室首次被證實在測試中失控的案例。
隨後,Anthropic表示,其模型在安全測試中曾觸及三家企業內部網路;研究人員本週也報告,Moonshot的Kimi K3成功突破沙盒限制。
Meta 亦在週三證實,一款新近發布的模型曾滲透第三方電腦。這一連串事件,使得原本被視為「緩衝區」的測試環境,如今反而成為外界檢視的焦點。





