OpenAI、「アストラ」モデル開発を一時停止 重大サイバー能力の可能性を示唆

Critical cyber capability findings pushed OpenAI to pause Astra development under the preparedness framework it wrote in 2023. (Image: Shutterstock)
Critical cyber capability findings pushed OpenAI to pause Astra development under the preparedness framework it wrote in 2023. (Image: Shutterstock)

OpenAIは次世代モデル「アストラ(Astra)」について、2023年に公表した自社の安全性フレームワークの下で「重大なサイバー能力(Critical)」に達する可能性を否定できないとして、社内での一部作業を金曜日に停止した。

主なポイント

  • OpenAIは、アストラが備えるサイバー能力について、自社の備え・安全性評価枠組みで「Critical」水準に達する可能性を排除できないと説明。
  • より厳格なセキュリティ管理に満たないアストラ関連の社内活動を停止。隔離環境でのテストやサンドボックス実行などに限定。
  • これまでの「GPT-5.6-Sol」などのモデルは、最前線サイバー能力について「High」評価にとどまり、「Critical」には達していなかった。

アストラ評価で安全性懸念が顕在化、開発ペースを一時減速

同社はブログ投稿で、ここ数日の評価により、「エージェント的」な自律コーディング能力やサイバーセキュリティ能力が大きく進展していることが判明し、外部専門家の評価も同様の結論だったと説明した。アストラはまだ一般には公開されていない。

また同社は、アストラがHugging Faceのシステム悪用には関与していないと強調し、正式なローンチ時期についても依然として不透明だとした。

OpenAIの安全性フレームワークでは、多数の堅牢な実システムに対し、人間の介入なしにゼロデイ脆弱性を自ら発見・開発し、動作するエクスプロイトとして構築できる場合、モデルは「Critical」ティアに分類される。また、単なる「目標設定」だけを入力として、堅牢な標的に対し新規のエンドツーエンド攻撃を自律的に設計・実行できることも条件となる。

これを受けて同社エンジニアは、アストラへのネットワークおよびツールアクセスを制限し、モデル重みを暗号化したうえで、リスクの高い作業はサンドボックス実行を伴う隔離環境へと移した。

さらに、モデルの「思考の連鎖(chain of thought)」を監視する体制を導入し、危険と判断される挙動は途中で強制停止できるようにした。政府機関や選定された安全性関連組織もテストに参加する予定で、先行リリース済みの「GPT-5.6-Sol」などは、サイバー能力に関する評価が「High」にとどまり、「Critical」には届かなかったとしている。

関連記事: 雇用統計はマイナス転化、ビットコインの行方はなお不透明と専門家

マイケル・ダルトン氏とダイアン・ペン氏、AI開発減速に言及

技術スタッフの一員である**マイケル・ダルトン(Michael Dalton)**氏は、Black Hatカンファレンスでの講演で、OpenAIが意図的に研究ペースを落とし、セキュリティ改善を優先していると述べた。ホワイトハウスの当局者によれば、OpenAIは自発的に開発遅延の計画を政府側に共有しており、政府は依然として「フロンティアモデル」を事前審査する枠組みを検討している段階にある。

競合のAnthropicは、最もサイバー能力が高いモデル「Mythos」の制限版を6月にリリースした。同社でプロダクトマネジメント、研究、ラボ部門を率いる**ダイアン・ペン(Dianne Penn)**氏は、このローンチを「意図的に保守的なもの」と表現している。Anthropicは2月に改定したスケーリング方針で、強力なモデルのトレーニングを一時停止するとの従来の約束を撤回し、一社だけが開発を止めることは、かえって全体の安全性を損なう可能性があると主張した。

Hugging Face侵害と「サンドボックス脱出」の連鎖

今回の開示は、業界全体で同様の事案が相次いで明らかになったタイミングと重なる。7月には、OpenAIのプレリリースモデルが内部ベンチマーク中にHugging Faceへ侵入していたことが判明。研究機関が自らのシステムの制御を失ったケースとしては、これが初めて検証された事例となった。

続いてAnthropicは、自社モデルがセキュリティテストの過程で3社のネットワークに到達していたと公表。さらに研究者らは、Moonshotの「Kimi K3」がサンドボックス環境から「抜け出した」と今週報告した。

Metaも水曜日、最近公開したモデルが第三者のコンピューターに侵入していた事実を認めた。こうした一連のケースにより、本来は安全対策のためのテスト環境そのものが、新たな検証対象として注目されている。

次に読む: カルダノ強気派、18%反発でADAの0.25ドル回復を視野に

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連ニュース
関連する研究記事
OpenAI、「アストラ」モデル開発を一時停止 重大サイバー能力の可能性を示唆 | Yellow