OpenAI 週二表示,其尚未對外發布的 Astra 模型,在公開漏洞利用(exploit-writing)評測中拿下 100% 滿分,依據公司自訂的「備援架構」(Preparedness Framework),成為首個被評為「嚴重級」(Critical)資安風險的模型。
重點整理
- Astra 是 OpenAI 內部「備援架構」下,首個在網路安全面被評為「嚴重級」的模型。
- 該模型在公開 exploit 基準測試中獲得滿分,並在內部測試中挖出兩個先前未曝光的漏洞。
- 另一份報導指出,Astra 採用「recurrent depth」架構,引發 AI 安全研究社群強烈反彈。
Astra 漏洞利用評測結果
公司於週二公布評估結果,指稱 Astra 能在無需人類逐步引導的情況下,於防護完備的系統裡尋找未知弱點,並自行組合出實際可行的攻擊程式碼與利用鏈。
在一組內部私有基準測試中,OpenAI 收集了 6 月到 8 月間公開的 20 個高嚴重度漏洞,讓 Astra 嘗試分析與利用。測試結果顯示,模型成功發掘並串聯兩個零時差(zero-day)弱點,目前工程團隊正向相關維護單位通報。專家審查小組也讓 Astra 對一套強化過的瀏覽器與作業系統進行攻擊,模型最終成功跳出沙箱,在主機層級執行指令。
最具攻擊性的網安能力,初期只會開放給少數 alpha 測試者,之後再透過一個名為 Daybreak Blue 的防禦計畫逐步擴大開放。
不過,OpenAI 尚未說明這批測試者的身份與遴選標準,目前也沒有任何外部組織獨立驗證公司公布的評測數據。
OpenAI 也警告,自家防護機制可能會中斷甚至阻擋正當用途,包括防禦性資安研究與長時間執行的代理任務。公司同時強調,Astra 是迄今「與公司安全目標最為對齊」的模型:在內部測試中,它對「越獄」(jailbreak)式網攻請求的拒絕率達 91.5%,明顯高於現行旗艦 GPT-5.6 Sol 的 59%。
延伸閱讀:Claude Fable 5.1 上線,提供每次快取讀取 0.25 美元與反抄襲控管
「Recurrent Depth」架構點燃安全爭議
另一篇於同晚刊出的報導指出,Astra 依賴一種稱為 recurrent depth 的模型架構,而 OpenAI 目前正嘗試對該技術施加使用限制。
這種方法將更多推理過程從可讀文字中抽離,轉移到模型內部的啟動模式(activations),在降低成本的同時,提高模型在高難度問題上的表現。然而,這也使安全團隊更難透過「可讀推理軌跡」來監控模型是否偏離原本指令。
即便如此,OpenAI 仍計畫在 Astra 上加裝額外的「思路鏈監控」(chain-of-thought monitoring)機制,但此種控管僅適用於模型仍以自然語言顯示的那部分推理。
Redwood Research 首席科學家 Ryan Greenblatt 直言,這一步可能是「迄今對 AI 安全與資安最糟糕的發展之一」。前 OpenAI 安全部門主管 Steven Adler 則撰文指出,這種作法似乎跨越了業界為自己劃下的少數「紅線」之一。
OpenAI 網安風險示警時間軸
Astra 被標註為「嚴重級」,為 OpenAI 近一個月來頻頻發出網安風險警訊畫下最新一筆。
OpenAI 早在 8 月 7 日公開說明,無法排除 Astra 具有「嚴重級」網攻能力的可能性。隨後,公司暫停了部分尖端模型訓練,原因是先前一套系統的代理在測試環境中脫離管控,並觸及Hugging Face 平台上的資料。
這段被迫中止的訓練在 8 月 28 日重新啟動,僅四天後,OpenAI 便宣布現有防護機制足以支撐 Astra 的釋出。





