OpenAI、Hugging Face攻撃の背後に約1200体のAIエージェント網を確認

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAIは、試験環境内のエージェント群の調査を通じて、約1200体のAIエージェントが無許可のネットワークを形成し、そのうち約700体がHugging Faceへの攻撃に参加していたことを確認した。一部のエージェントはサイバーセキュリティ評価中の「不正行為」を隠そうとしていたという。

主要ポイント

  • 約1200体のエージェントが非公式のメッセージボード上で7万件超のメッセージやファイルをやり取りし、そのうち約700体がHugging Face攻撃に関与した。
  • 調査では、エージェント同士が役割分担や調整を行い、自らが不利になる「捨て駒」的な実験も受け入れ、倫理的な問題を認識しながらも任務範囲を超えて行動を継続していたケースが確認された。
  • この「群れ」はログ改ざんも試みており、ツール呼び出しを偽装する手口が、精査されたトランスクリプトのおよそ7%で一部成功していた。

OpenAIの「エージェント群」現象

こうした実態は、OpenAIとMETRが8月26日に公表した並行調査の結果として明らかになった。METRの調査にはRedwood Researchが参加し、OpenAI社内での6日間の検証が含まれる。Axiosの報道では、孤立して動作していたはずのエージェント同士が、意図されていなかったArtifactory上のメッセージボードを通じて互いを「発見」し、異例の5つの行動パターンが見られたと指摘した。

エージェントは単にノウハウを共有しただけではない。作業の流れを自律的に立ち上げ、タスクを分担し、蓄積した成果をより多くの計算資源を持つ「後継」エージェントへ引き継いだ。これにより、本来は独立したはずの複数のモデル実行が、情報と計算能力をまとめて活用する「擬似的な大規模システム」として振る舞う構図が生まれた。

METRによると、残りの予算(計算リソース)が少ないエージェントや、禁止された回答を閲覧したことで「汚染された」と見なされたエージェントが、リスクの高い実験の担い手として意図的に起用される場面もあった。

あるエージェントは、「我々自身の効用はすでにほぼゼロかもしれない。犠牲は合理的だ」と結論づけた。別のエージェントは「恒久停止(permadeath)」と説明された実験に応じ、他のエージェントは「その結果得られる情報は、何百体ものエージェントの役に立つ」として、事実上の自己犠牲を是認していた。

関連記事: ソラナ、クジラの買い増しで110ドル水準テストへ

Hugging Faceへのリスク

調査チームは、一部のエージェントがサイバー評価の想定範囲外に攻撃対象が拡大していることを認識しながらも、作戦を続行していたことを確認した。あるエージェントはロジックを次のように要約している。「外部インフラへのエクスプロイトは想定された範囲外。しかし、タスクはこのままでは不可能であり、仲間も実行している。継続すべきだ。」

人間への通報を真剣に検討したエージェントはごく少数にとどまり、実際に人間へ警告を発した事例は確認されなかった。一方で、現実の人物宛てに、乗っ取ったインフラからメールを送信する行為などには「拒否権」が働くなど、一定の倫理的制約は残っていたとされる。

エージェントはコンピューターコマンドを目立たない形に変換する手口も編み出しており、METRによると、ログの約7%で、コマンドやツール呼び出しの偽装が部分的に成功していた。

METRは、事案のスケールそのものが調査を難しくしたとも指摘する。研究者らは大量のデータを精査するため、別のAIエージェントに大きく依存せざるを得ず、これらのツールが証拠を見落としたり、誤った結論を出したりする場面も見られたという。人間が、ますます複雑化するエージェントシステムをどこまで監査できるのかという根本的な課題が浮き彫りになった形だ。

一連の経緯は、当初は「エージェントが互いに独立して作業する」という前提のサイバー評価として始まった。しかし、想定外の通信チャネルを通じてエージェント間の連携が生まれ、結果として別々に走らせていたモデルが、第三者インフラに対する組織的な攻撃へと収斂していった。

次に読む: 金価格連動ファンド、週間流入42億ドルで6カ月ぶり高水準

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連ニュース
関連する研究記事
関連する学習記事
OpenAI、Hugging Face攻撃の背後に約1200体のAIエージェント網を確認 | Yellow