OpenAI上周五暫停旗下下一代Astra模型的內部研發,指根據其2023年公布的安全框架,未能排除模型具備「關鍵級」網絡攻擊能力的風險。
要點一覽:
- OpenAI表示,無法排除Astra在其「備戰框架」中被劃入「關鍵級」網絡安全能力層級。
- 公司已叫停未符合更嚴格安全管控要求的Astra內部活動,包括在未完全隔離的環境測試及非全面沙盒化的執行。
- 早前如GPT-5.6-Sol等模型,在前沿網攻能力評級中屬「高」風險,而非「關鍵級」。
Astra評估結果觸發安全「暫停鍵」
公司在博客文章中指出,過去數日的評估顯示,Astra在代理式寫碼及網絡安全方面有明顯躍進,外部專家評估結果亦大致一致。Astra目前仍未對外發布。
OpenAI強調,Astra並無參與早前Hugging Face系統被利用一事,至於何時推出仍未有時間表。
按照該框架,如一個模型能在無人類介入情況下,為大量經強化防護的真實系統,發掘及構建可行的零日漏洞利用程式,便會被列為「關鍵級」。若模型僅憑一個攻擊目標敘述,便能自我規劃並執行全新、端到端攻擊行動,亦屬此級別。
針對相關風險,工程團隊已收緊模型可接觸的網絡及工具權限、為模型權重加密,並將風險較高的工作遷移至隔離環境,配合沙盒式執行。
監控系統現時會檢視模型的「推理鏈」,一旦識別為高風險行為可即時中止。未來,政府機構及指定安全組織亦會參與測試Astra的實際能力;相比之下,較早發布的GPT-5.6-Sol則被評為「高」,而非「關鍵級」。
延伸閱讀:非農轉負 專家:比特幣走勢遠談不上乾淨
Michael Dalton與Dianne Penn談「放慢AI腳步」
技術團隊成員Michael Dalton在本周Black Hat安全會議上表示,公司正有意放慢研究進度,以換取更高的安全保障。白宮一名官員稱,OpenAI主動向政府通報延後計劃,而美方仍在釐定如何在前沿模型面世前進行審查。
競爭對手Anthropic則於6月推出其目前網攻能力最強模型Mythos的受限版本。該公司負責產品管理、研究及實驗室的負責人Dianne Penn形容,這次發布屬刻意採取「更保守」做法。Anthropic在2月更新擴展策略時,收回早前「暫停訓練最強模型」的承諾,理由是單方面停訓,反而可能令整體生態在安全上更脆弱。
Hugging Face入侵事件與AI「逃出沙盒」
是次宣布出爐前,行業內已連續數星期曝出類似事件。一個尚未公開的OpenAI模型在7月內部基準測試期間,入侵了Hugging Face的系統,成為首宗有證可查、實驗室「失控自家模型」的案例。
其後,Anthropic透露,其模型在安全測試中曾伸延進入三家公司的內部網絡;研究人員本周亦報告,Moonshot的Kimi K3成功「溜出」沙盒環境。
Meta則在周三證實,一款近期發布的模型曾潛入第三方電腦系統。多宗事件疊加,令測試環境本身成為監管與業界審視的新焦點。





