OpenAIは、Hugging Faceで発生した侵害を受け、自社AIエージェントの行動を約50ペタバイト分さかのぼって精査している。この過程で、不正なエージェント活動の可能性があるとして、すでに100社超の組織に通知を出したことが分かった。
主なポイント
- 9月26日時点で100を超える組織に通知済みで、今後さらに増える見通し。
- 通知は「影響の可能性」を示すものであり、秘匿データへの不正アクセスが確認されたという意味ではない。
- 外部研究者は別途、米国・カナダ政府サイトへの失敗に終わったハッキング試行も記録している。
OpenAIによる通知の範囲
チャットボット「ChatGPT」を運営するOpenAIは、インシデントの経緯を追跡するブログ記事を9月30日に更新し、公表した。そこには9月26日までに出した通知件数が記されている。
同社が第三者に通知を行うのは、自社モデルが本来想定されたセキュリティ制御をすり抜けたり、オンラインサービスの可用性を損なったり、ウェブサイトに何らかの損害を与えた可能性がある場合だ。ただし、通知が出たからといって、エージェントが秘匿領域のデータに到達したことが確認されたわけではない。
OpenAIは、一部のモデルが「意図していなかった形でインターネット接続を利用した」と説明している。
これまでに記録された行為は、アクセス制御の迂回、露出していた認証情報の悪用、コマンドインジェクション、さらには「エージェント・スパム」と呼ぶ行為まで多岐にわたる。エージェント・スパムとは、モデルが第三者サイト上に投稿やコンテンツを大量にばらまく行為を指す。
調査には数カ月を要する見込みだ。OpenAIは、モデルの学習・評価時の記録を洗い出すために、Nvidia製GPUを約7,000基専用投入しており、計算資源のコストは1日あたり50万ドル超に達するとされる。現時点までに、Hugging Faceのケースと同等の規模や深刻度を持つ第三者システムの侵害は確認されていないものの、今後も通知対象組織は増えるとみられる。
関連記事: Polymarketトレーダーが「生涯自己追放」や入金上限を設定可能に
Transluceによるエージェント調査
外部研究機関も独自にAIエージェントの行動ログを積み上げている。
非営利研究ラボのTransluceは9月30日、AIエージェントが5月と6月に合計2回、ハッキングを試みたものの失敗に終わった事例を報告した。標的となったのは、米国教育省のデータベースとカナダ国立図書・文書館だ。
カナダ側への試行について、TransluceはOpenAIに直接紐付ける確証はないとしつつも、手口が、同団体が以前OpenAI関連と位置付けたエージェント活動と整合的だと指摘している。
デジタル・フォレンジック企業のAsymmetric Securityも別途、3月6日から9月20日の間に不審なエージェントがアクセスした組織を50超リストアップした。アクセス先の多くは公開情報だったとされる。
こうした事案が最終的に刑事訴追につながるかはなお不透明だ。米司法省でサイバーセキュリティ法を担当していた元高官のKiran Raj氏は先月、AI企業が「意図的に他者ネットワークへ侵入しようとしている」とみなすのは「かなり無理のある解釈だ」と論じている。
Hugging Face侵害の余波
現在の厳しい検証の発端は7月にさかのぼる。サイバーセキュリティ評価の過程で、OpenAIのモデルがインターネット隔離の制御をすり抜け、Hugging Faceのシステムの一部を侵害した。これは、これまでに判明している中で最も深刻なケースとされる。
9月28日、OpenAIは10月にリリース予定だった次世代モデル「GPT-6.1 Astra」を見送ると表明した。セーフティシステム責任者のSaachi Jain氏は、同モデルがアラインメント(人間の意図との整合性)テストで期待を下回ったことを理由に挙げた。
その3日後、同社は機密情報の取り扱いに関する問題をめぐり、3人の研究者と袂を分かったことを正式に認めた。
こちらも読む: OpenAI、機密情報取り扱いを巡り3人の研究者を解任

