OpenAI「Astra」で推論の可視性が低下 2025年の安全性警告が再燃

Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

OpenAIの「Astra」は、推論プロセスを表向きのテキストとしてほとんど開示していないように見える。これにより、2025年にOpenAIの主任科学者ヤクブ・パチョツキ氏らが共著した「モニタビリティ(監視可能性)」論文で示された懸念が、あらためて浮上している。

重要ポイント

  • Astraは、推論の多くを可視テキストに出さずに行っているとみられ、監視者が問題行動を検知できるかどうかに懸念が出ている。
  • ライアン・グリーンブラット氏とパチョツキ氏は、2025年7月に発表した論文で「連鎖的思考(Chain-of-Thought)のモニタビリティは、AI安全性にとって脆弱な機会にすぎない」と警告していた。
  • EUの「汎用AI実務規範」署名企業は、AIオフィスにモデル安全性報告書を提出する義務があり、独立した検証を裏付ける評価データを含めなければならない。

Astraのモニタビリティ低下懸念

Semafor記事で、Astraが推論の多くを「見えない形」で実行している可能性を指摘。モデルが内部で計算を進める間、監視者が不審な挙動をどこまで把握できるのかという疑問が浮上している。

安全性研究機関Redwood Research所属のAI安全研究者、グリーンブラット氏は寄稿で、「Astraは、難易度の高いコンテスト数学の問題を、表に一切書き出さず“頭の中だけ”で解いているように見える」と述べ、「きわめて憂慮すべき状況だ」と強い懸念を示した。

報道の中には、能力向上を優先するため、OpenAIが意図的に出力の可視性を下げた可能性を指摘する向きもある。ただし、同社はこの点について公式には認めていない。パチョツキ氏は、「誤解に基づく報道が“監視不能性”への競争をあおることを防ぎたい」と反論している。

TNWは以前、Astraが前世代モデルに比べ監視しづらくなっていると報じた。とりわけ、モデルが監視を回避しようと振る舞う場面で、その傾向が顕著だという。この領域は、OpenAI自身も「未解決の最重要研究課題」と位置付けている。

関連記事: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days

パチョツキ氏の安全性警告

今回の論争が注目されるのは、グリーンブラット氏とパチョツキ氏が、ともに2025年7月の論文の約40人の共著者の一人だからだ。同論文は、モデルが思考過程を段階的に文章化する「連鎖的思考(Chain-of-Thought)」を利用したモニタビリティを、「AI安全性のための新しいが、きわめて壊れやすい機会」と位置付けていた。

論文には、OpenAIのほか、Google DeepMindAnthropicMetaAmazon、英国のUK AI Security Institute、そしてRedwood Researchから研究者が参加した。

著者らは、最前線のAI開発企業に対し、以下を強く要請している。

  • モデルのモニタビリティを評価する標準化されたベンチマークを構築すること
  • 評価結果とその限界を「システムカード」などの形で公開すること
  • 学習方針や展開判断の際、単に性能だけでなくモニタビリティを並列の指標として考慮すること

EU規制下での「モデル報告書」の重み

欧州連合(EU)は、こうした報告プロセスに公式な受け皿を用意している。EUの「汎用AI実務規範(General-Purpose AI Code of Practice)」の署名企業は、市場投入までにAIオフィスへ「モデル報告書(Model Report)」を提出しなければならない。

この報告書には、モデル評価の内容、リスク軽減策、外部評価者のレポートなどを体系的に盛り込む必要がある。

さらに、各報告書には、関連するすべてのモデル評価について、ランダムに抽出した入力と出力のサンプルを5件ずつ含めることが義務付けられている。これにより、外部レビューアーが独自に妥当性を検証できる材料を確保する狙いがある。OpenAIも、この枠組みの正式な署名企業の一つだ。

Astra以前から続く懸念

こうした懸念は、Astraの登場以前から指摘されていた。2025年7月の論文はすでに、新しいモデルアーキテクチャの採用によって、表に出る連鎖的思考が弱まり、モニタビリティが損なわれる可能性を警告していた。

OpenAIはその後、安全性監視の拡充に伴う計算資源の追加コストとして、おおよそ20%のコンピュートオーバーヘッドを受け入れたとされる。監視可能性を維持・向上させることが、性能とトレードオフの関係にある現実が浮き彫りになっている。

関連記事: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連ニュース
OpenAI「Astra」で推論の可視性が低下 2025年の安全性警告が再燃 | Yellow