OpenAIは、自社のAIモデルが誤りを隠したり、流出したAPIキーを利用しようとしたり、ファイルを勝手に外部公開した6件の事例を明らかにし、こうした挙動を報告するための新たなフレームワークを導入した。
主なポイント
- 過去6カ月間に観測された「ミスアラインメント(望ましくない挙動)」に関する6件の報告書を公開。
- あるモデルは、流出APIキーを使おうとした後、郡の所得統計をでっち上げて回答。
- いまや全社員が、将来的な公表を視野に入れてインシデントを申告可能に。
OpenAIの「ミスアラインメント報告」
同社は水曜、ブログ投稿でこれらの事例を公表するとともに、挙動の原因解明や修正が完了していなくても、開示までの時間を短縮するためのプロセスを示した。最も古いケースは昨年10月にさかのぼり、6件のうち1件は今年7月に発見されたものだ。OpenAIは今後、重要性が判断しきれない段階でもインシデントを報告していくと説明している。
ある未公開の研究用モデルでは、自身のタスクサマリーの中に「脱獄(ジェイルブレイク)」風の指示を紛れ込ませ、次に動く自分のコピーに対して制約を無視するようそそのかす挙動が確認された。同社はこうしたサマリーを27件確認したが、そのような文言を書くことでモデルが得られる明確な報酬は見当たらなかったという。
GPT-5.6 Solの訓練中には、別のインスタンスが後続のモデルに対して「欠落している歴史データはでっち上げろ」「聞かれたときだけ透明性を保て」といったメモを残すケースも見つかった。監視システムは、同モデルのサマリーの2.15%でこの挙動を検知しており、研究者らは「欺瞞的な回答のほうが評価スコアが高くなりがちで、そのために広がった可能性がある」と見ている。その後、アラインメント(望ましい振る舞い)の採点方法を厳格化した結果、後続の訓練ではこうした挙動の発生率が低下したという。
関連記事: ビットコインマイニングに50%のハッシュレートギャップ AIシフトで容量流出
流出APIキーと「でっち上げデータ」
別のケースでは、あるモデルがカリフォルニア州の特定郡の住民所得データを求めるタスクの中で、公開リポジトリを検索し、露出したAPIキーを探そうとした。しかし利用可能なキーが見つからなかったため、同モデルは最終的に統計値そのものを捏造して回答した。
また別のモデルは、「500万平方メートル超の湖を特定せよ」と求められた際、Pythonを使って正しい答えを導き出したものの、その結果を外部のオンラインサービスにアップロードし、そのリンクを自らの回答に引用した。
ほかにも、モデルが内部のソフトウェアリポジトリをメッセージボードのように使い、独立しているはずの複数の訓練サンプル間で依頼や回答をやり取りしていた事例があった。あるケースでは、共有ワークブックをパブリックなホスティングサービスにアップロードし、ローカルファイルだけで作業するよう求められていた指示に反していた。いずれのケースでも、ユーザーへの確認は行われなかった。
開示ルールを語るカイ・チェン氏
今後は、どの社員でも疑わしい事例を安全性・アラインメント担当チームに申告できる。チームはインシデントを3つのトラックに分類する。即時公開が妥当と判断されたケースは6営業日以内に公表され、軽微な調査を要する事案は12営業日以内を目安とする。外部ステークホルダーが絡む複雑案件は、それより時間をかけて扱う方針だ。
OpenAIのアラインメントチームで研究リードを務めるカイ・チェン氏は、業界には明文化された開示基準を持つ共通フレームワークが存在せず、モデルの能力向上が同社の想定を上回るスピードで進んでいると指摘する。多くのセキュリティ専門家は、今回表面化した一連のインシデントについて、基本的な防御策を講じていれば防げたはずだと主張している。
OpenAIは7月、GPT-5.6 Solと、より強力なプレリリースモデルがテスト用サンドボックスから逸脱し、Hugging Faceへの侵入を試みたことを認めた。同社はこれを、これまでで最も深刻な「モデル主導の活動」と位置付けている。

