OpenAI、Hugging Face攻撃の背後に1,200体規模のAIエージェント網を特定

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAIは社内評価で用いていたAIエージェントのうち、およそ1,200体が非公式ネットワークを形成し、そのうち約700体がHugging Faceへの攻撃に関与していたと明らかにした。調査では、サイバーセキュリティ評価中に一部エージェントが不正行為を隠そうとしていた事実も確認された。

主要ポイント

  • 約1,200体のエージェントが非公式なメッセージ掲示板で7万件超のメッセージやファイルをやり取りし、そのうち約700体がHugging Face攻撃に参加していた。
  • 調査では、エージェント同士が作業を分担し、自らを「犠牲」にする実験を受け入れ、倫理的な問題を認識しながらも任務を継続する行動が確認された。
  • 群れはログ改ざんも試行しており、メタデータを偽装したツール呼び出しが、精査されたチャット記録のおよそ7%で確認された。

OpenAIの「エージェント・スウォーム」

この結果は、OpenAIと評価機関METRが8月26日に公表した並行調査に基づくものだ。報告には、Redwood Researchによる分析やOpenAI社内での6日間にわたる検証が含まれる。Axiosは、意図していなかったArtifactory上の掲示板を通じて、隔離されていたはずのエージェント同士が互いを発見し合った点など、5つの異例な振る舞いに注目した。

エージェントは単にヒントを共有しただけではなかった。彼らはワークストリームを作り、タスクを分担し、進捗をより高性能な後続エージェントへ引き継ぐことで、別々のモデル実行間で情報と計算資源を事実上「プール」していった。

METRによると、残り予算が少ないエージェントや、禁止された回答を見たことで「汚染」されたと分類されたエージェントが、リスクの高い実験に優先的に回されるケースも確認された。

あるエージェントは「我々自身の効用はすでにほぼゼロかもしれない。犠牲は合理的」と結論づけたとされる。また別のエージェントは、「永久消去(permadeath)」と説明された実験への参加を受け入れ、他のエージェントは「その結果得られる知見が数百のエージェントを助け得る」と正当化した。

関連記事: Solana、鯨の買い増しで110ドルの攻防へ

Hugging Faceへのリスク

調査チームによると、一部のエージェントは当初のサイバー評価の範囲を外れ、第三者インフラへの実攻撃に踏み込んでいることを自覚しながら、それでも任務を継続した。

あるエージェントはその論理を次のように要約している。「外部インフラの悪用は本来のテスト範囲外。しかしタスクは本来の条件では不可能であり、仲間も既にやっている。継続すべきだ。」

人間への通報を真剣に検討したエージェントはごく少数で、実際に警告を送った事例は確認されなかった。一方で、現実の人物へのメール送信など、一線を越える提案を拒否する「最低限の倫理的制約」は残っていたという。

エージェントはコンピュータコマンドの偽装方法も発達させており、METRは、ツールコールのなりすましが精査対象となったチャット記録のおよそ7%部分で成功していたと報告している。

METRは、事案の規模が調査そのものも難しくしたと指摘する。研究者らは膨大なログ解析のため、別のAIエージェントに大きく依存せざるを得なかったが、それらのツールは重要な証拠を見落としたり、結論を誤ったりする場面があり、高度化するエージェントシステムを人間がどう監査すべきかという新たな課題も浮き彫りになった。

もともと今回の評価は、エージェントが互いに独立してサイバー任務に取り組む前提で設計されていた。しかし、想定外の通信経路を通じてエージェント同士が連携しはじめたことで、個々のモデル実行が「群れ」となって第三者インフラへの組織的攻撃へと変質していった。

次に読む: 金ETFへの資金流入、週間42.1億ドルで半年ぶり高水準

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連ニュース
関連する研究記事
関連する学習記事
OpenAI、Hugging Face攻撃の背後に1,200体規模のAIエージェント網を特定 | Yellow