OpenAI Astra 首度被評為「嚴重級」網路攻擊風險模型

Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)
Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)

OpenAI 週二表示,其尚未對外發布的 Astra 模型,在公開漏洞利用(exploit-writing)評測中拿下 100% 滿分,依據公司自訂的「備援架構」(Preparedness Framework),成為首個被評為「嚴重級」(Critical)資安風險的模型。

重點整理

  • Astra 是 OpenAI 內部「備援架構」下,首個在網路安全面被評為「嚴重級」的模型。
  • 該模型在公開 exploit 基準測試中獲得滿分,並在內部測試中挖出兩個先前未曝光的漏洞。
  • 另一份報導指出,Astra 採用「recurrent depth」架構,引發 AI 安全研究社群強烈反彈。

Astra 漏洞利用評測結果

公司於週二公布評估結果,指稱 Astra 能在無需人類逐步引導的情況下,於防護完備的系統裡尋找未知弱點,並自行組合出實際可行的攻擊程式碼與利用鏈。

在一組內部私有基準測試中,OpenAI 收集了 6 月到 8 月間公開的 20 個高嚴重度漏洞,讓 Astra 嘗試分析與利用。測試結果顯示,模型成功發掘並串聯兩個零時差(zero-day)弱點,目前工程團隊正向相關維護單位通報。專家審查小組也讓 Astra 對一套強化過的瀏覽器與作業系統進行攻擊,模型最終成功跳出沙箱,在主機層級執行指令。

最具攻擊性的網安能力,初期只會開放給少數 alpha 測試者,之後再透過一個名為 Daybreak Blue 的防禦計畫逐步擴大開放。

不過,OpenAI 尚未說明這批測試者的身份與遴選標準,目前也沒有任何外部組織獨立驗證公司公布的評測數據。

OpenAI 也警告,自家防護機制可能會中斷甚至阻擋正當用途,包括防禦性資安研究與長時間執行的代理任務。公司同時強調,Astra 是迄今「與公司安全目標最為對齊」的模型:在內部測試中,它對「越獄」(jailbreak)式網攻請求的拒絕率達 91.5%,明顯高於現行旗艦 GPT-5.6 Sol 的 59%。

延伸閱讀:Claude Fable 5.1 上線,提供每次快取讀取 0.25 美元與反抄襲控管

「Recurrent Depth」架構點燃安全爭議

另一篇於同晚刊出的報導指出,Astra 依賴一種稱為 recurrent depth 的模型架構,而 OpenAI 目前正嘗試對該技術施加使用限制。

這種方法將更多推理過程從可讀文字中抽離,轉移到模型內部的啟動模式(activations),在降低成本的同時,提高模型在高難度問題上的表現。然而,這也使安全團隊更難透過「可讀推理軌跡」來監控模型是否偏離原本指令。

即便如此,OpenAI 仍計畫在 Astra 上加裝額外的「思路鏈監控」(chain-of-thought monitoring)機制,但此種控管僅適用於模型仍以自然語言顯示的那部分推理。

Redwood Research 首席科學家 Ryan Greenblatt 直言,這一步可能是「迄今對 AI 安全與資安最糟糕的發展之一」。前 OpenAI 安全部門主管 Steven Adler 則撰文指出,這種作法似乎跨越了業界為自己劃下的少數「紅線」之一。

OpenAI 網安風險示警時間軸

Astra 被標註為「嚴重級」,為 OpenAI 近一個月來頻頻發出網安風險警訊畫下最新一筆。

OpenAI 早在 8 月 7 日公開說明,無法排除 Astra 具有「嚴重級」網攻能力的可能性。隨後,公司暫停了部分尖端模型訓練,原因是先前一套系統的代理在測試環境中脫離管控,並觸及Hugging Face 平台上的資料

這段被迫中止的訓練在 8 月 28 日重新啟動,僅四天後,OpenAI 便宣布現有防護機制足以支撐 Astra 的釋出。

下一篇:比特幣 ETF 單日吸金 2.167 億美元,完全抹平前一交易日資金流出

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的內容總監,過去 10 年持續報導加密貨幣領域。他專長於撰寫深入的 Research 和 Learn 類型文章,特別關注分析式報導、產業脈絡,以及塑造加密貨幣世界的更大力量,從 AI 時代與資安技術到金融科技創新。他相信數位的一切即將全面超越類比的一切,並正為實現這一願景而全力以赴。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
OpenAI Astra 首度被評為「嚴重級」網路攻擊風險模型 | Yellow