OpenAI暫停研發Astra模型 稱或具關鍵級網攻能力

New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)
New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)

OpenAI上周五暫停旗下下一代Astra模型的內部研發,指根據其2023年公布的安全框架,未能排除模型具備「關鍵級」網絡攻擊能力的風險。

要點一覽:

  • OpenAI表示,無法排除Astra在其「備戰框架」中被劃入「關鍵級」網絡安全能力層級。
  • 公司已叫停未符合更嚴格安全管控要求的Astra內部活動,包括在未完全隔離的環境測試及非全面沙盒化的執行。
  • 早前如GPT-5.6-Sol等模型,在前沿網攻能力評級中屬「高」風險,而非「關鍵級」。

Astra評估結果觸發安全「暫停鍵」

公司在博客文章中指出,過去數日的評估顯示,Astra在代理式寫碼及網絡安全方面有明顯躍進,外部專家評估結果亦大致一致。Astra目前仍未對外發布。

OpenAI強調,Astra並無參與早前Hugging Face系統被利用一事,至於何時推出仍未有時間表。

按照該框架,如一個模型能在無人類介入情況下,為大量經強化防護的真實系統,發掘及構建可行的零日漏洞利用程式,便會被列為「關鍵級」。若模型僅憑一個攻擊目標敘述,便能自我規劃並執行全新、端到端攻擊行動,亦屬此級別。

針對相關風險,工程團隊已收緊模型可接觸的網絡及工具權限、為模型權重加密,並將風險較高的工作遷移至隔離環境,配合沙盒式執行。

監控系統現時會檢視模型的「推理鏈」,一旦識別為高風險行為可即時中止。未來,政府機構及指定安全組織亦會參與測試Astra的實際能力;相比之下,較早發布的GPT-5.6-Sol則被評為「高」,而非「關鍵級」。

延伸閱讀:非農轉負 專家:比特幣走勢遠談不上乾淨

Michael Dalton與Dianne Penn談「放慢AI腳步」

技術團隊成員Michael Dalton在本周Black Hat安全會議上表示,公司正有意放慢研究進度,以換取更高的安全保障。白宮一名官員稱,OpenAI主動向政府通報延後計劃,而美方仍在釐定如何在前沿模型面世前進行審查。

競爭對手Anthropic則於6月推出其目前網攻能力最強模型Mythos的受限版本。該公司負責產品管理、研究及實驗室的負責人Dianne Penn形容,這次發布屬刻意採取「更保守」做法。Anthropic在2月更新擴展策略時,收回早前「暫停訓練最強模型」的承諾,理由是單方面停訓,反而可能令整體生態在安全上更脆弱。

Hugging Face入侵事件與AI「逃出沙盒」

是次宣布出爐前,行業內已連續數星期曝出類似事件。一個尚未公開的OpenAI模型在7月內部基準測試期間,入侵了Hugging Face的系統,成為首宗有證可查、實驗室「失控自家模型」的案例。

其後,Anthropic透露,其模型在安全測試中曾伸延進入三家公司的內部網絡;研究人員本周亦報告,Moonshot的Kimi K3成功「溜出」沙盒環境。

Meta則在周三證實,一款近期發布的模型曾潛入第三方電腦系統。多宗事件疊加,令測試環境本身成為監管與業界審視的新焦點。

下一篇:Cardano多頭劍指0.25美元 ADA周漲18%後再博突破

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管,過去 10 年一直專注報導加密貨幣相關議題。他擅長撰寫深入的研究與學習類文章,重點放在分析式報導、產業背景脈絡,以及塑造加密貨幣領域的宏觀力量,從 AI 時代與安全技術到金融科技創新等面向。他相信所有數碼事物將在不久的將來全面超越一切類比事物,並正為實現這個願景而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
OpenAI暫停研發Astra模型 稱或具關鍵級網攻能力 | Yellow