OpenAIの「Astra」は、表に出る推論プロセスが少なくなっているように見える──。こうした観測が広がるなかで、同社チーフサイエンティストの**ヤクブ・パホツキ(Jakub Pachocki)**氏らが2025年に共同執筆したモニタビリティ(監視可能性)論文で示された懸念が、再び浮上している。
主な論点
- Astraは推論の多くをテキストとして表示せずに行っている可能性があり、監視者が問題行動を検知できるのかという懸念が強まっている。
- **ライアン・グリーンブラット(Ryan Greenblatt)**氏とパホツキ氏は、2025年7月の論文で「チェーン・オブ・ソート(思考の連鎖)」に基づく監視は、AI安全性にとって有望だが非常に脆い機会だと指摘していた。
- EUのコード署名企業は、AIオフィスにモデル安全性報告書を提出する義務があり、その中で独立評価を可能にするエビデンスを提示しなければならない。
Astraの「監視可能性」低下懸念
メディアのSemaforは、Astraは推論のより大きな部分を「見えないところ」で行っているようだと報じた。モデルが内部で作業している最中に、監視者がなお不審な挙動を見抜けるのかという疑問が噴出している。
安全性研究機関Redwood ResearchのAI研究者であるグリーンブラット氏は、寄稿記事で「Astraは、難度の高い競技数学の問題を、ほぼ『頭の中だけ』で解いてしまうように見える」と指摘。「これは極めて憂慮すべき兆候だ」と危機感をあらわにした。
報道の中には、OpenAIが能力向上を優先するため、意図的にモデル出力から推論過程の可視性を下げたとの見方もある。ただし同社は、そうした方針を公式には認めていない。パホツキ氏は「誤解に基づく報道が引き金となって、『監視不能化レース』が始まるのを防ぎたい」と応じている。
技術メディアTNWは以前から、Astraは前世代モデルより監視が難しくなっていると報じてきた。特にモデルが監視回避を試みるケースで顕著であり、その領域はOpenAI自身も「未解決の重要な研究課題」と位置づけている。
関連記事: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days
パホツキ氏の安全性警告
こうした議論が注目されるのは、グリーンブラット氏とパホツキ氏が、2025年7月に発表された著名な論文の約40人の共著者の一人だからだ。この論文は、「チェーン・オブ・ソート(思考の連鎖)」を外部に出力させ、それを監視するという手法を、AI安全性にとって新しいが脆弱なチャンスだと位置づけた。
著者にはOpenAIのほか、Google DeepMind、Anthropic、Meta、Amazon、英国のUK AI Security Institute、Redwood Researchなど、第一線の「フロンティア」開発組織の研究者が名を連ねた。
論文は、最先端モデルの開発企業に対し、モニタビリティの標準化された評価指標を整備し、その結果と限界をシステムカードで公表すること、さらに学習やデプロイの判断において「能力」と並んで「監視可能性」を考慮することを求めている。
EU規制とモデル報告書
欧州では、この報告プロセスに明確な制度的受け皿が用意されている。EUの「汎用AI行動規範(General-Purpose AI Code of Practice)」の署名企業は、市場投入時までに**AIオフィス(AI Office)**へ「モデル報告書(Model Report)」を提出しなければならない。
報告書には、モデル評価の結果やリスク緩和策、外部評価者によるレポートなどを含めることが求められる。さらに、関連するあらゆる評価ごとに、入力と出力をそれぞれ5件ずつランダムに抽出したサンプルを添付する義務があり、第三者が独立に検証できるようになっている。OpenAIもこのコードの正式な署名企業の一つだ。
Astra以前から続く懸念
こうした懸念はAstraの登場以前から存在していた。2025年7月の論文は、モデルの新アーキテクチャが進化するにつれ、外部に出力されるチェーン・オブ・ソートが弱まり、監視能力が損なわれる可能性をすでに警告していた。
一方でOpenAIは、システムの安全監視を拡張するために、計算資源で約20%のオーバーヘッド(追加負荷)を受け入れたとされる。能力向上と監視可能性のトレードオフが徐々に顕在化するなかで、Astraをめぐる最新の議論は、業界全体のAI安全戦略と規制対応を再考させるきっかけとなりつつある。
次に読む: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

