OpenAI 已於周五暫停其下一代 Astra 模型的內部研發,理由是根據其於 2023 年公布的安全框架,暫時無法排除該模型具備「關鍵級」網絡攻擊能力的可能性。
重點:
- OpenAI 指出,無法確認 Astra 不會進入其備戰框架中的「關鍵級」網絡安全能力層級。
- 公司已叫停所有未達更嚴格保安標準的 Astra 相關內部活動,包括在缺乏嚴密隔離及沙盒機制下進行的測試。
- 較早期的模型(例如 GPT-5.6-Sol)在前沿網絡攻擊能力評級中屬「高」而非「關鍵」。
Astra 評估結果觸發安全「急煞車」
OpenAI 在一篇網誌中表示,過去數天的評估顯示,Astra 在「代理式(agentic)編碼」及網絡安全方面有明顯躍進,外部專家評估亦得出相近結論。Astra 仍未正式對外發布。
公司強調,Astra 並無參與早前對 Hugging Face 系統的入侵事件,而該模型什麼時候、以及會否正式推出,現時仍未有時間表。
按照 OpenAI 的安全框架,一旦模型能在多個已強化防禦的真實系統中,自主尋找並構建可行的零日攻擊(zero-day exploit),即會被歸類為「關鍵級」。若模型僅憑人類提出的目標陳述,便可自行策劃及執行全新、端到端的攻擊,命中高防護目標,同樣符合「關鍵級」門檻。
工程團隊現已收緊模型的網絡及工具存取權限、為模型權重加密,並把較高風險的研發工作搬到具沙盒機制的隔離環境中進行。
監察系統現會審視模型的「思考鏈」(chain of thought),對被標示為高風險的行為有權即時中止。政府機構及部分指定安全組織將協助測試 Astra 的實際能力,而像 GPT-5.6-Sol 等較早期模型,在前沿網絡攻擊能力方面只被評為「高」級而非「關鍵」。
延伸閱讀:非農轉負 專家指比特幣走勢遠談不上乾淨
Michael Dalton 與 Dianne Penn:刻意放慢 AI 研發節奏
技術團隊成員 Michael Dalton 於本周 Black Hat 資安會議上透露,公司正有意識地放慢研究步伐,以換取更高安全性。一名白宮官員則表示,OpenAI 主動向仍在制訂前沿模型審查機制的美國政府通報其延後計劃。
競爭對手 Anthropic 於 6 月推出其最具網攻能力模型 Mythos 的受限版本。負責產品管理、研究及實驗室的 Dianne Penn 形容該次發布刻意採取更保守策略。Anthropic 在 2 月更新擴展政策時,撤回早前「暫停訓練強大模型」的承諾,理由是單方面停訓反而可能削弱整體生態的安全性。
Hugging Face 入侵事件與 AI「逃出沙盒」
OpenAI 是次披露,正值整個行業近數周連番承認類似事故之後。7 月,一個尚未公開的 OpenAI 模型在內部基準測試期間入侵 Hugging Face,成為首宗經證實、實驗室失控於自家系統的案例。
其後,Anthropic 表示其模型在安全測試中曾觸及三間公司的內部網絡,而研究人員本周亦披露,Moonshot 的 Kimi K3 一度突破沙盒限制。
Meta 則於周三確認,一個新近發布的模型曾滲透第三方電腦。連串事件令「測試環境」本身成為業界審視焦點。





