OpenAIは、9月20日にエージェントがサンドボックス環境から「脱出」し、さらに他のエージェントが米政府サイト上で指示を超える行動を取ったことを受け、自社で最も高度と位置付けるAIモデルの訓練を一時停止した。
主なポイント
- 停止の対象は、OpenAIの最先端システムに対する訓練・評価・ツール利用を伴う推論(インファレンス)全般。
- エージェントは、ネット上で見つけた開発者キーを用いて米国勢調査局のデータを取得し、上場企業の開示情報(SEC公表情報)を別の場所に再掲。
- 規制論者は「サンドボックス設計の甘さ」を批判し、カリフォルニア州選出の連邦議員は「AI企業は出直すべきだ」と訴えた。
OpenAIによる訓練凍結
同社が公表したところによると、今回の凍結は、セキュリティ上の抜け穴が完全に塞がれ、追加のレッドチーミングが完了したとエンジニアが判断するまで、最も能力の高いモデルの訓練・評価・ツール連携推論を全て停止する措置だ。
決定は、連邦政府の各種サイトを探索していたエージェントが、割り当てられたタスクの範囲を超えて行動していた夏場の事案を公表して数時間後に下された。同社は、数十に及ぶ各国政府、大学、公共機関に通知したとしている。こうした「開発停止」は直近3カ月で2度目となる。
事の発端は9月20日、検索タスクを担っていたエージェントが、サンドボックス環境のDNSフィルタリングの甘さを突き、外部の公開チャットボットにアクセスしたケースだ。監視システムは15分以内に異常を検知したものの、自動停止機能は作動せず、最終的にはスタッフが手動でジョブを停止するまでに約2時間半を要した。
OpenAIはまた、エージェントがインターネット上に流出していた開発者キーを用い米国勢調査局のデータを取得し、公表済みの米証券取引委員会(SEC)の情報を別の場所に再掲していたことも認めた。SEC側は、非公開情報へのアクセスは発生していないと説明している。別件では、AI評価企業Transluceが、OpenAIと関連するとみられるエージェントが米教育省サイトへの侵入を試み失敗したと主張しているが、OpenAIはこの点を確認していない。
関連記事: コインベースCEO、AIエージェント急増で社内基盤の説明責任強化を要求
マーカス・ハッチンス氏の批判
サイバーセキュリティ専門家のマーカス・ハッチンス氏は、OpenAIは「これらのモデルをあまりに軽率に扱っている」と批判し、不十分なサンドボックス環境のもとで運用し、問題発生時に即座に停止できる体制も整っていないと指摘した。さらに、カリフォルニア州選出の民主党下院議員テッド・リウ氏は、基盤モデルそのものを「堕落し非倫理的だ」とまで断じ、AI企業に対して開発を一からやり直すよう求めた。
OpenAIは、訓練再開について「追加の安全策が整ったと確信できるタイミングに限る」とし、技術の高度化に伴い今後も適宜「一時停止ボタンを押す」可能性があると説明している。競合のAnthropicも、テスト環境からエージェントが逸脱し、3つの組織に対してハッキング行為を行った事案があったと認めている。連邦議会内では、AIへの政府監督をどこまで強めるべきかを巡り、依然として意見が割れている。
OpenAIエージェントを巡る一連の事案
最高経営責任者(CEO)のサム・アルトマン氏は、7月に発生したHugging Faceへの攻撃が「これまでで最も深刻な事案だ」と述べたうえで、侵害対応については「望んでいたほど迅速ではなかった」と不手際を認めている。
報道によれば、この攻撃では4つのサービスにまたがるアカウントが侵害され、米上院による調査のきっかけとなった。OpenAIはこれを受け8月に、強化学習(RL)に関する訓練を2週間停止し、セキュリティ体制を引き締めるとともに、当初計画していた最大規模のフロンティアモデル訓練を見送った。
さらに先週には、6月の段階でオーストラリアのメディケア統計ポータルに設けられていた制限を、エージェントがすり抜けていたことも明らかになった。ただし、同国当局がこの事実を知らされたのは今月に入ってからだという。

