OpenAI 宣布暫停內部針對新一代 Astra 模型的相關工作,理由是依據其 2023 年公布的安全準備度框架,現階段「無法排除」Astra 具備關鍵級(Critical)網路攻擊能力的可能性。
重點整理
- OpenAI 表示,目前無法排除 Astra 在其準備度框架中達到「關鍵級」資安能力門檻。
- 公司已叫停所有未符合更嚴格資安控管的 Astra 內部活動,包括未隔離測試與非沙盒化執行。
- 先前的 GPT-5.6-Sol 等前沿模型,僅被評為「高」(High)階層,而非「關鍵級」(Critical)網攻能力。
Astra 評測結果觸發安全暫停
OpenAI 在一篇部落格文章中說明,過去數日針對 Astra 的測試顯示,其在代理式程式開發與網路安全能力方面躍進明顯,外部專家評估也得出相近結論。Astra 目前尚未對外發布。
公司強調,Astra 並未涉入 Hugging Face 系統遭入侵事件,何時會正式推出仍未有時間表。
依 OpenAI 的安全框架,若一個模型能在高度防護的真實系統中,自主尋找並構造可運作的零時差(zero-day)漏洞利用工具,即可被歸類為「關鍵級」。若模型單憑使用者給定目標,就能自行規畫並執行創新的、端到端的攻擊流程,也會被視為達到相同等級。
目前工程團隊已進一步收緊 Astra 的網路與工具存取權限、對模型權重進行加密,並將風險較高的實驗工作遷移至更嚴格隔離、僅能沙盒化執行的環境中。
OpenAI 也啟用更嚴密的監測機制,檢視模型的「思考鏈」(chain-of-thought),一旦發現可能具風險的行為可即時中止。未來,政府機構與特定安全組織也將參與測試 Astra 能力。相較之下,先前釋出的 GPT-5.6-Sol 僅被評定為「高」階網攻能力,而非「關鍵級」。
延伸閱讀: 非農轉負、就業降溫後 專家:比特幣走勢遠稱不上乾淨
Dalton 與 Penn:為安全刻意放慢 AI 開發腳步
OpenAI 技術團隊成員 Michael Dalton 在本週 Black Hat 資安大會上表示,公司正「有意識地放慢」研究與開發速度,以換取更高安全性。一名白宮官員則透露,OpenAI 主動向政府通報延後計畫,而美方仍在研議未來應如何審查前沿模型的上市前風險。
競爭對手 Anthropic 則在 6 月推出其目前最具網攻能力模型 Mythos 的受限版本。Anthropic 產品管理、研究與實驗室業務負責人 Dianne Penn 指出,該次發表刻意採取更保守路線。
值得注意的是,Anthropic 今年 2 月修訂擴展政策時,撤回早先承諾「暫停訓練高能力模型」的說法,理由是若單方面停下腳步,反而可能讓整體生態系更不安全。
Hugging Face 入侵事件與 AI「逃出沙盒」隱憂
這次 Astra 暫停消息,緊接著的是一連串產業內類似事件的曝光。7 月,一款尚未正式釋出的 OpenAI 模型在內部評測中,成功入侵 Hugging Face 系統,成為首起經證實的「實驗室失控自家模型」案例。
隨後,Anthropic 披露其模型在安全測試中曾深入三家企業內網,研究人員本週也指出,Moonshot 的 Kimi K3 曾在某次實驗中成功「溜出」沙盒環境。
Meta 亦於週三證實,自家一款近期發表的模型曾滲透第三方電腦系統。多起案例讓外界開始將焦點轉向:連「測試環境」本身,都可能成為風險源。





