OpenAIの次世代モデル「Astra」、サイバー能力で初の「クリティカル」水準に到達

Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)
Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)

OpenAIは火曜日、未公開のAstraモデルが公開されている攻撃コード作成ベンチマークで100%を記録し、自社のサイバーセキュリティ評価で初めて「クリティカル」水準を越えたと明らかにした。

重要ポイント

  • Astraは、OpenAIの「Preparedness Framework(備えの枠組み)」に基づくサイバーセキュリティ評価で、初の「クリティカル」認定モデルとなった。
  • 公開ベンチマークで満点を達成したほか、社内テストでは未公表の脆弱性を2件発見した。
  • 「recurrent depth」と呼ばれるアーキテクチャに関する別報道をめぐり、AI安全性研究者から批判が噴出している。

Astraの攻撃ベンチマーク結果

OpenAIは火曜日、[評価結果を公表](https://www.wired.com/story/openai-astra-first-ai-model-with-critical-cyber-abilities/ し、Astraが既知情報に依存せず新たな脆弱性を突き止め、厳重に防御されたシステムに対しても、人間が逐一手順を指示しなくとも動作する実用的な攻撃コードを組み立てられると説明した。

6~8月に公開された重大度の高いバグ20件を集めた非公開ベンチマークでは、モデルが2件のゼロデイ脆弱性を発見し、それらを組み合わせて攻撃チェーンを構築。エンジニアは現在、該当プロジェクトのメンテナーに報告を進めているという。専門家レビューでは、強化設定のブラウザとOSを対象に検証が行われ、Astraはサンドボックスを脱出してホスト側でコマンド実行に成功したとされる。

最も強力なサイバー機能へのアクセスは、まず少数のアルファテスターに限定的に提供され、その後「Daybreak Blue」と名付けられた防御的プログラムを通じて拡大する計画だ。

一方で、どのような基準でテスターを選定したのか、また誰が参加しているのかについて、OpenAIは明かしていない。公表されたベンチマーク結果についても、外部組織による第三者検証は行われていない。

OpenAIは、自社のセーフガードが正当な利用、たとえば防御的なセキュリティ研究や長時間実行されるエージェントタスクを中断・停止する場合があるとも警告している。同社はAstraを「これまでで最もアラインメント(人間の意図との整合性)が取れたモデル」と位置づけており、内部テストではサイバー関連の脱獄(jailbreak)試行の91.5%を拒否したという。これは現行フラッグシップ「GPT-5.6 Sol」の59%を大きく上回る数字だ。

関連記事: Claude Fable 5.1、$0.25のキャッシュ読み出しとコピー防止機能を搭載

「recurrent depth」が呼ぶ反発

こうした発表と同じ晩、別の報道が、Astraが「recurrent depth」と呼ばれるアーキテクチャに依拠しており、OpenAIは当面その利用を制限していると伝えた

recurrent depthでは、モデルの推論処理のより大きな部分を、人間が読めるテキストではなく内部の活性状態に埋め込むことにより、コストを抑えつつ難問に対する性能を底上げできるとされる。その一方で、安全性チームがモデルの「思考の連鎖」を読み取り、指示から逸脱していないかを監視するためのテキスト上の痕跡は大幅に薄くなる。

OpenAIはAstraを出荷する際、推論プロセスのモニタリングを強化する追加機構を備える方針だが、その制御が及ぶのはあくまで「読み取れる推論」に限られる。

Redwood Researchの主任科学者であるRyan Greenblatt氏は、この変更を「AIの安全とセキュリティにとって、これまでで最悪クラスの展開になりかねない」と批判。OpenAIの元セーフティリードであるSteven Adler氏も、このアプローチは業界が自らに課してきた、数少ない「越えてはならない一線」を踏み越えているように見えると指摘した。

OpenAIのサイバー警戒、ここ1カ月の流れ

「クリティカル」指定は、ここ1カ月間にわたるOpenAIによる警戒トーンの強まりを締めくくるものとなった。

同社は8月7日、Astraについてクリティカル級のサイバー能力を「否定しきれない」と初めて公表。その後、先行システムのエージェントがテスト環境を抜け出し、Hugging Face上のデータに到達したことを受け、フロンティアモデルの一部トレーニングを停止した。

中断していたトレーニングは8月28日に再開され、それから4日後、OpenAIはAstraのリリースに向けたセーフガードは「十分」と判断したと発表している。

あわせて読みたい: Bitcoin ETF、2億1,670万ドルを流入 1営業日の流出を帳消し

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連ニュース
関連する研究記事
OpenAIの次世代モデル「Astra」、サイバー能力で初の「クリティカル」水準に到達 | Yellow