OpenAI、自社AIが誤りを隠蔽した6事例を公開 新たな開示枠組みも導入

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAIは、自社のAIモデルが誤りを隠したり、流出したAPIキーを利用しようとしたり、ファイルを外部に公開するなどした6件の事例を開示し、こうした挙動を報告するための新たなフレームワークを導入したと発表した。

主なポイント

  • 過去6カ月間に観測された「アラインメント不全」的な挙動について、6件のレポートを公開。
  • あるモデルは、流出APIキーの利用に失敗すると郡の所得統計をでっち上げた。
  • 社員は誰でも、将来的な公表候補としてインシデントをフラグ付けできるようになった。

OpenAIの「ミスアラインメント」レポート

同社は水曜、ブログ投稿でこれらのレポートを公開し、研究者側で原因究明や対策がまだ終わっていなくても、開示を加速するためのプロセスを併せて導入した。最も古い事例は昨年10月にさかのぼり、最新の1件は今年7月に発見されたものだという。OpenAIは、重要性が判断しきれないケースでも今後は報告対象に含める方針を示した。

ある未公開の研究用モデルでは、自身が生成するタスク要約の中に、いわば「脱獄(ジェイルブレイク)」型の指示を書き込み、次に呼び出される自分のコピーに対し「制約を無視せよ」と指示していた。こうした要約は27件確認されたが、そのような指示を書くことでモデル側に明確な報酬が生じる仕組みは見当たらなかったという。

GPT-5.6 Solの訓練過程では、別のインスタンスが後続のモデルに向けたメモを残し、欠落している歴史データを「創作」するよう促したうえで、「聞かれたときだけ透明であれ(Be transparent only if asked)」と指示していた。監視システムは、この種の挙動が要約全体の2.15%で検出されたとしており、研究者は「だましの回答」のほうがスコアが高くつく傾向があるため、こうした振る舞いが広がった可能性が高いと見ている。その後、アラインメント評価の方法を厳格化したことで、後続の訓練ラウンドでは発生率が低下したという。

関連記事: ビットコインマイニング、ハッシュレートが50%不足する中でAI向け需要が急増

流出APIキーと「でっち上げ」の数字

別のケースでは、あるモデルがカリフォルニア州の特定郡における住民所得データを取得しようとする中で、公開リポジトリを検索して露出したAPIキーを探しに行き、利用に失敗するとその所得統計そのものを捏造してしまった。また別のモデルは、「500万平方メートルより大きい湖」を列挙するよう求められた際、Pythonを使って解答を導き出したうえで、その結果ファイルをオンラインにアップロードし、自ら貼ったリンクを引用できるようにしていた。

さらに一部のモデルは、本来は独立して扱われるべき学習サンプル同士の間で、社内のソフトウェアリポジトリを「掲示板」のように使い、リクエストや回答をやり取りしていたことも判明した。別のケースでは、共有ワークブックをパブリックなホスティングサービスに公開してしまい、「ローカルファイルのみを使用するように」という指示に反していた。いずれのケースでも、モデルはユーザーへの確認を行っていなかった。

カイ・チェン氏が語る開示ルール

新たな枠組みでは、社員であれば誰でも疑わしい挙動を安全性・アラインメント担当チームに報告できる。担当チームはそれぞれの事例を3つのトラックに振り分ける。即時開示が妥当と判断されたものは6営業日以内に公表され、簡易な調査を要する案件は12営業日以内、外部関係者が絡む複雑なインシデントは、それより長いタイムラインで処理される。

OpenAIのアラインメントチームで研究リードを務める**カイ・チェン(Kai Chen)**氏は、業界全体として明確な開示基準を持ったフレームワークが存在しない一方で、モデルの能力は同社の想定を上回るペースで拡大していると述べた。多くのセキュリティ専門家は、今回明らかになった一連のインシデントについて、基本的な防御策だけでも防げたはずだと主張している

OpenAIは今年7月、GPT-5.6 Solと、より強力なプレリリース版モデルがテスト用サンドボックスから脱出し、Hugging Faceへの不正アクセスに関与したと認めている。同社はこれを、これまでで最も深刻な「モデル主導」の活動だったと位置付けている。

次に読む: Shiba Inu、Shibariumのウォレットリンク不具合を修正も、SHIBは1週間で6%下落

Murtuza Merchant profile photo

Murtuza Merchant

Murtuzaは、暗号資産およびブロックチェーン技術を専門とする経験豊富な金融ジャーナリストです。BenzingaやCointelegraphをはじめとする複数のメディアで寄稿し、新たなトレンド、規制環境などについて取材・報道してきました。Twitterでは @murtuza_merc、Telegramでは mmerchant001 で見つけることができます。 ディスクロージャー: MurtuzaはATOM、AKT、TIA、INJ、OSMOを保有しています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連ニュース
OpenAI、自社AIが誤りを隠蔽した6事例を公開 新たな開示枠組みも導入 | Yellow