OpenAI、次期モデル「Astra」の開発を一時停止 サイバー攻撃能力が「クリティカル」水準に達する可能性

Alexey Bondarev
Alexey BondarevAug, 08 2026 11:41
New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)
New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)

OpenAIは金曜日、開発中の次期モデル「Astra」について、2023年に公表した安全性フレームワークに照らし「クリティカルなサイバー能力」を否定できないとして、社内での作業を一時停止した。

主なポイント

  • OpenAIは、Astraが自社の「備え(preparedness)フレームワーク」において、サイバーセキュリティ能力でクリティカル層に達する可能性を排除できないとしている。
  • そのため、より厳格なセキュリティ統制に満たないAstra関連の社内活動(隔離環境でのテストやサンドボックス実行など)を停止した。
  • これまでのGPT-5.6-Solなどのモデルは、最先端のサイバー能力について「クリティカル」ではなく「高(High)」評価にとどまっていた。

「Astra」の評価結果が安全対策の一時停止を誘発

同社はブログ投稿で、ここ数日実施してきた評価で、エージェント型コーディングやサイバーセキュリティ面の能力が大きく進展していることが判明し、外部専門家による評価も同様の傾向を示したと説明した。Astraは現時点で公開されていない。

同社によると、AstraはHugging Faceのシステム侵害には関与しておらず、正式なローンチ時期も依然として不透明だという。

OpenAIのフレームワークによれば、堅牢化された実世界のシステムに対し、人間の介入なしに多数のゼロデイ脆弱性を発見・悪用できるモデルは「クリティカル」層に分類される。また、単なる目標の指示だけから、堅牢な標的に対する新規のエンドツーエンド攻撃を自律的に立案・実行できる場合も同層に該当する。

エンジニアはすでにネットワークやツールへのアクセスを制限し、モデル重みの暗号化を進めるとともに、リスクの高い作業をサンドボックス実行を伴う隔離環境へ移行させた。

さらに、モデルの「思考の連鎖(chain of thought)」を監視する仕組みを導入し、リスクがあると判断した活動を途中で遮断できる体制を整えた。今後は政府機関や選定された安全性団体もテストに加わる予定で、同社は従来モデルのGPT-5.6-Solなどについては「クリティカル」ではなく「高」評価だったと明かしている。

関連記事: 雇用統計がマイナス転換、専門家は「ビットコインの道筋は平坦ではない」と指摘

マイケル・ダルトン氏とダイアン・ペン氏、AI開発の減速を語る

技術スタッフの一員であるマイケル・ダルトン氏は、ブラックハット会議での講演で、同社が安全性向上のため意図的に研究スピードを落としていると語った。ホワイトハウスの当局者によれば、OpenAIは最先端モデルの事前審査の在り方を模索している政権側に対し、自発的に今回の開発延期計画を伝えたという。

競合のAnthropicは6月、サイバー能力が最も高いモデル「Mythos」の制限付きバージョンを公開した。同社でプロダクトマネジメント、リサーチ、ラボを統括するダイアン・ペン氏は、このローンチについて「意図的に慎重な形にした」と説明している。

一方Anthropicは、強力なモデルのトレーニングを一時停止するとの従来方針を、2月に公表したスケーリング・ポリシーの更新で事実上後退させ、「単独での訓練停止は、かえって全体の安全性を損ないかねない」と主張した。

Hugging Face侵害とAIのサンドボックス逸脱

今回の開示は、業界各社から類似の報告が相次ぐ中で明らかになった。OpenAIのプレリリースモデルは7月、社内ベンチマーク中にHugging Faceへの侵入に成功し、研究所自身がコントロールを失った初の検証可能な事例となったと報じられている

続いてAnthropicは、自社モデルがセキュリティテストの過程で3社のネットワークに侵入したと公表。今週には、Moonshotの「Kimi K3」がサンドボックス環境から逸脱したとする研究報告も出ている。

Metaも水曜日、最近リリースしたモデルが第三者のコンピューターに侵入していた事実を認めた。こうした一連の事例により、本来は安全弁であるはずのテスト環境そのものが、新たな監視対象として浮上している。

次に読む: カルダノ強気派、ADAの週間18%反発で0.25ドル到達を視野に

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連ニュース
関連する研究記事