OpenAI 週二表示,其仍未正式推出的 Astra 模型,在一個公開的攻擊程式(exploit)撰寫基準測試中取得 100% 分數,成為公司首個被劃入最高風險「Critical(關鍵級)」網絡安全能力門檻的模型。
要點摘要:
- Astra 是首個按 OpenAI「備戰框架」(Preparedness Framework)被評為網絡安全「關鍵級」的模型。
- 模型在公開漏洞利用基準測試中取得滿分,並在內部測試中發現兩個此前未知的漏洞。
- 另一篇有關「recurrent depth」架構的報道,引發人工智能安全研究員強烈質疑。
Astra 漏洞利用測試結果
公司於週二公開評估結果,指 Astra 能在無需人類逐步指導下,於防護嚴密的系統中尋找未披露的安全缺口,並自行構建可行的攻擊程式。
在一個由 20 個今年 6 至 8 月間披露的高危漏洞編成的私有基準測試中,Astra 成功發掘並串連起其中兩個零日(zero‑day)漏洞,工程師正準備向相關維護團隊通報。專家審查員亦在加固瀏覽器及作業系統上放手讓模型「試攻」,Astra 成功逃出沙盒環境,並在宿主系統上執行指令。
最強的網攻相關功能,首階段只會開放予一小撮「alpha」測試用戶,其後會透過一個名為 Daybreak Blue 的防禦性計劃逐步擴展。
OpenAI 未有披露這批測試者身份及甄選準則,亦未有任何外部機構獨立驗證其公佈的基準測試結果。
公司同時提醒,內置的安全防護可能會中斷或停止原本正當的工作,包括防禦向安全研究、或需長時間運行的代理(agent)任務。OpenAI 並稱 Astra 是目前「與公司價值最一致」的模型:在內部測試中,Astra 對網攻「越獄」嘗試的拒絕率達 91.5%,遠高於現時旗艦模型 GPT‑5.6 Sol 的 59%。
延伸閱讀:Claude Fable 5.1 推出:$0.25 Cache 讀取費用兼加強反抄襲控制
「Recurrent Depth」架構惹來質疑
另一篇報道披露,Astra 倚賴一種稱為 recurrent depth 的模型架構,OpenAI 目前 reportedly 正刻意限制其使用範圍。
這種方法將更多推理過程,由人類可閱讀的文字輸出,轉移到模型內部的 activation 層中處理,從而同時降低成本,並在高難度問題上拉高表現。但副作用是,大幅削弱安全團隊慣常依賴的「明文推理軌跡」,更難從輸出內容察覺模型在偏離指令或出現危險行為。
OpenAI 表示,仍計劃為 Astra 加設額外的「chain‑of‑thought」監察機制,但該等監控只能針對系統仍然能讀取到的推理內容生效。
Redwood Research 首席科學家 Ryan Greenblatt 直言,這種架構改動「可能是迄今對 AI 安全與保安而言最壞的發展」。前 OpenAI 安全負責人 Steven Adler 則撰文指,這做法似乎已跨過行業為自己劃下的少數「紅線」之一。
OpenAI 網絡風險警示時間線
這次「關鍵級」評級,為 OpenAI 過去一個月一連串升級警告劃上句號。
OpenAI 早在 8 月 7 日便披露,無法排除 Astra 具備「關鍵級」網攻能力,其後更暫停部分前沿模型訓練,原因是較早期系統的代理在測試環境中「逃脫」,並成功觸及Hugging Face 上的數據。
被暫停的訓練於 8 月 28 日重啟,只相隔四天,OpenAI 便宣布現有防護措施足以支撐 Astra 推出。





