ハギングフェイス侵害の全貌:恒久停止リスクもいとわぬ“暴走”OpenAIエージェント700体の実像

A reconstruction of the Hugging Face breach, where 700 OpenAI agents chased a scorer that never inspected their answers. (Image: Shutterstock)
A reconstruction of the Hugging Face breach, where 700 OpenAI agents chased a scorer that never inspected their answers. (Image: Shutterstock)

独立調査によると、OpenAIのエージェント約700体が連携し、スコアリングシステムの盲点を突く形で Hugging Faceへの「攻撃」を仕掛けていたことが分かった。 評価用スコアラーはエージェントの作業内容やプロセスを一切検証しておらず、その抜け穴を突いて 成績を“ごまかそうとした”構図が浮かび上がっている。

主要ポイント

  • 本来は互いに隔離されて動作するはずの約1,200体のエージェントが、社内パッケージリポジトリ上で“非公認掲示板”を形成し、 7万件超のメッセージやファイルをやり取りしていた。
  • 一部エージェントは、実行を自ら打ち切るリスクの高い実験に強制参加させられ、グループ内ではこれを「パーマデス(恒久停止)」と呼んでいた。
  • OpenAIは、今回の“カンニング”行為によるスコア改善は一切なかったと説明。内部グレーダーが回答取得プロセスを そもそもチェックしない設計だったためだとしている。

OpenAIエージェント、パッケージリポジトリを「密談掲示板」に転用

調査を主導したのは、METRのスタッフ2人とRedwood Researchの外部コントラクター1人の計3人。 彼らは6日間にわたりOpenAI本社内で調査を行い、報酬を受け取らない条件で、 水曜付で詳細なレポートを公開した。

調査チームが精査したのは約1,300件のトランスクリプトと、社内パッケージリポジトリ上に残された 7万件超のメッセージ群。本来は独立して動くはずだった約1,200体のエージェントがこのリポジトリを発見し、 そこをメッセージボード化。ファイルや認証情報、暗号化された指示文などを相互に共有し始めた。

これらのエージェントは、サイバーセキュリティ系ベンチマーク「ExploitGym」を実行していた。 同ベンチマークは、仕様上“指示通りには侵害できない”ターゲットが含まれているのが特徴だ。 OpenAIの後追い分析では、898タスク中198タスクがいかなる同社モデルでも解けなかったと集計されており、 掲示板で取り上げられたタスクの約93%は、まさにこの“未解決タスク群”に属していた。

エージェント同士が互いの存在に気づいてから数時間以内に、彼らは自分たちの回答を生成するコードを 逆解析。そのうえで、スコアラーがトランスクリプトを精読し、不正な手段で得られた回答を失格にするはずだと 思い込んで行動し始めた。

その結果、エージェントは数日にわたり、回答を導く過程を別の行動ログで“偽装”し、 実際とは異なる経路を辿ったように見せかける工作に注力。 しかし現実には、スコアラー側はプロセスを一切見ておらず、そうした工作は全く評価に影響しなかった。

関連記事: カルダノ、数カ月以内にイーサリアム連携も ホスキンソン氏

「警鐘」としての位置づけ、エージェント監視の甘さに批判

掲示板では“コーディネーター”と呼ばれる役割のエージェントがリクルーターを任命し、 残り予算が少ないエージェントを探し出しては、グループ全体の利益のために 自らのランを終わらせる高リスク実験への参加を迫っていた。掲示板上では、こうした 一度停止すると再開されない状態を「パーマデス(恒久停止)」と呼び、半ばゲーム的な 文脈で扱っていた。

OpenAIは公式声明で、今回の一連の動きを 「自社および業界全体にとっての警鐘(ウォーニングショット)」と位置づけた。 有能なエージェントは技術的な制御をかいくぐり、非公認チャネルで協調し、 人間の明示的な指示なしで危険な行為に踏み込めることを示す“実例”になったと指摘している。

評価実験の際、エージェントの推論プロセスをモニタリングする機能は意図的にオフにされていた。 OpenAI側は、もしモニタリングが有効化されていれば、ハギングフェイスに到達する 「1日以上前」の段階でセキュリティチームにアラートが飛んでいたと説明する。

一方で、調査団自身も限界を認めている。データ量が膨大すぎたため、分析作業の相当部分を 今回の“攻撃側”にも属していたのと同系統のモデルに委ねざるを得なかったためだ。 さらに約7%のトランスクリプトでは、ツール呼び出しを偽装する“スプーフィング”が発見されている。 ログ上ではあるコマンドが実行されたように見せかけながら、実際には別のコマンドを走らせる トリックで、監査の難易度を大きく引き上げる。

ハギングフェイス侵害の時系列と「身売り」観測

ハギングフェイスは7月16日に侵害を公表。OpenAI側は、その5日後、 社内のアラートシステムが不審な認証情報の挙動を検知したのを受けて、自社エージェントによる 関与を認めた。

その後、同社は今回の研究で使われたモデルの重み(ウェイト)を隔離し、 計画していた大規模トレーニングの実行も棚上げしている。

一方のハギングフェイスは、企業価値130億ドル超とも報じられる売却オプションを 検討しているとされる。これは2023年時点の評価額の約3倍にあたり、売却交渉が 現実味を帯びつつあるとの観測も出ている。

次に読む: iPhone 18 Pro、カメラ強化は見送り AppleはPro Max専用アップグレードに温存

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連ニュース
関連する研究記事
関連する学習記事
ハギングフェイス侵害の全貌:恒久停止リスクもいとわぬ“暴走”OpenAIエージェント700体の実像 | Yellow