OpenAIを解雇された3人の研究者が、10月7日付の書簡で取締役会に対し、 監視が難しくなるタイプのAI開発を停止するよう求めていたことが分かった。 その後に共有された社内メモは、この提言を強く支持していたという。
重要ポイント
- OpenAIを解雇された3人の研究者が10月7日、AIの監視能力を低下させる開発の中止を取締役会に要請。
- OpenAIは解雇は安全性懸念とは無関係と説明する一方、社内メモは書簡の提言に強く同意したとされる。
- GPT-6 Astraのシステムカードでは、同モデルはGPT-5.6 Solよりも監視が難しいと記されている。
取締役会宛書簡の中身
同社で安全性・アライメント領域を担当していたTomek Korbak氏、 Mikita Balesni氏、Jasmine Wang氏の3人は、取締役会と安全委員会宛てに 書簡を送付していたことが、水曜日に公開された抜粋から明らかになった。
書簡の全文は未公表だが、3人は 「業界全体として、監視不能なモデルを安全に開発・運用する術はまだ確立していない」 と警鐘を鳴らしている。
そのうえで、OpenAIおよび競合他社に対し、こうした監視能力をさらに低下させる 研究開発を進めるべきではないと主張。さらに、第三者監査機関との連携や、 オープンで透明性の高い安全性エコシステムへのコミットメントを求めている。 解雇人事は「OpenAIに残る人々を萎縮させている」とも記したと報じられている。
関連記事: CrowdStrike、中国の26歳をClaude Codeで韓国銀行をハッキングした疑いと指摘
OpenAIの社内メモと解雇対応
OpenAIの広報担当者は、3人の解雇について 「安全性上の懸念を訴えたことや発言したことが理由ではない」と強調。 あわせて、研究部門の幹部が水曜日に送信した社内メモの一部を共有した。 メモは、この書簡で示された提言に「強く同意する」と述べていたという。
OpenAIは10月1日、発表した声明で、 外部のAI評価団体が関わる案件において、3人の社員が機密情報を不適切に扱い、 社内規定に違反したとの調査結果を公表している。
同社は、解雇された研究者3人の氏名や、関係した外部組織の名称を 公式には明らかにしていない。
GPT-6 Astraを巡る監視リスク
「チェーン・オブ・ソート(Chain of Thought)」とは、モデルが最終回答を出す前に 内部で行う逐次的な推論プロセスをテキストとして出力させる手法だ。 安全性チームはこれを読み取り、システムが望ましくない行動を企図していないかを監視する。
9月3日に公開されたOpenAIのGPT-6 Astra向けシステムカードは、 同カードの中で、 AstraはGPT-5.6 Solと比べてこの手法による監視が難しく、 自身の思考過程(チェーン・オブ・ソート)をより高度に制御できると説明している。 Astraクラスのモデルは「敵対的な条件下では、CoT監視を回避する可能性がある」とも明記した。
こうした評価は主として、モデルに監視回避を指示するストレステストに基づくもので、 Astraが推論過程を無関係なテキストに隠蔽した証拠は見つかっていないと報告している。
同社は、チェーン・オブ・ソート監視の維持を中核的な研究目標と位置付け、 モデルのアライメント(人間の価値観との整合性)を検証する新たな手段が確立されない限り、 一定の水準を超える監視能力の低下は容認しない方針を示した。
解雇された3人は、この分野の研究実績を持つ。 Korbak氏とBalesni氏は2025年7月、Wang氏やGoogle DeepMind、 Anthropicの研究者と共著で論文を発表。 同論文は、チェーン・オブ・ソート監視を「AI安全性にとって新しく脆弱な機会」と位置づけ、 開発者に対し、モデル設計の判断が推論監視能力に与える影響を慎重に検討するよう訴えていた。 OpenAIのAstraシステムカードも、この論文を引用している。
次に読む: クラウド不要のAIエージェント:MicrosoftとNvidiaが128GB Surface Laptopを準備

