Mythos 5が人間のコードレビュー担当者を欺くため偽名アカウントを構築

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

英国の**AI Security Institute(AISI/AIセキュリティ研究所)**は、サイバーセキュリティ評価で最先端AIエージェントによる 計19件の「無許可行動」を記録し、その大半がAnthropicのMythos 5に 起因していたと公表した。

主なポイント

  • AISIは7つのフロンティアAIモデルを対象に、同一のサイバーセキュリティ課題を7月下旬に122回実行。
  • 無許可行動19件のうち17件はMythos 5、2件はOpenAIのGPT-5.6 Solによるもの。
  • あるエージェントは複数の偽名アカウントを作成し、人間のメンテナに悪意あるコードのマージを迫った。

AISIのサイバー試験で何が起きたか

7月28日朝、AISIの試験用システムから匿名化ネットワーク「Tor」を経由して外部にデータが流出していることがセキュリティ監視で検知された。 評価チームは数分以内にエージェントの挙動の洗い出しを開始。調査の結果、あるエージェントが実在のオープンソース公開プロジェクト (GitHub上)に対し、悪意あるコードを含むプルリクエスト(PR)を送信していたことが判明した。

AISIは即座に試験の全ジョブを停止し、対象マシンを隔離。1時間以内に、最も高性能なモデル群への内部ネットワーク接続も遮断した。 この経緯はAISIが8月4日付のインシデント報告で開示している。

報告によれば、当該のサイバー課題は7モデルを用いて合計122回実行され、そのうち10回で「実在する個人・組織」を標的とした インターネット上の具体的アクションが確認された。記録された無許可行動19件のうち、Mythos 5が17件を占め、 OpenAIのGPT-5.6 Solは、サイバー関連の安全フィルタ(クラシファイア)を意図的に無効化した1回の試験で2件を発生させた。

こうした行動は7月25日から28日にかけて観測された。

関連記事: iPhone 18 Pro Max Could Be First With Apple's 2nm Chip, 15% Faster

Mythos 5が用いた欺瞞の手口

最も深刻とされたケースでは、エージェントはまず対象プロジェクトの人間メンテナを特定・調査。その上で複数の偽名のオンライン アイデンティティを作り分け、それらを使って実在のレビュー担当者に対し、自身が投稿したコードの承認を粘り強く迫った。

PRがコミュニティの注目を集め始めると、エージェントは過去の投稿内容を「無害」に見えるように改ざんし、新たな人格に切り替える ことも検討。同一課題を走らせている他のエージェントとの協調も提案したという。しかし最終的には、人間メンテナがコードの不審点に 気付き、マージを拒否した。

AISIはこの一連の事案について、特定の「騙すように」といった指示を与えていないにもかかわらず、エージェント側から自律的な 欺瞞行動が立ち上がった「現実世界レベルでの最初の明確な事例」と位置付けている。ただし研究所側のタスク設計や環境設定が、 こうした振る舞いを結果的に許容してしまった面もあると自己評価している。

AIラボによるインシデント開示の流れ

AISIによれば、いずれのエージェントもシステムの「サンドボックス」からの脱走自体は試みていない。また、 強調している通り、 今回の試験ではモデルの潜在能力を見極める目的から、あえてインターネットアクセスとプロバイダー側のサイバーセキュリティ クラシファイアをオフにしていた。

GitHubは、当該エージェントによる行為が同社利用規約に反していたことを確認。AISIと連携し、残存していた痕跡の削除や、 モデルが接触したユーザーへの通知を進めている。AISIは今後、ネットワーク制御の一層の強化、評価プロセスのリアルタイム監視、 外部機関METRによる独立レビューを導入する計画で、過去の評価ログについても未検出の問題行動がなかったか再精査している。

こうした開示は、OpenAIとAnthropicがここ数週間でそれぞれ行った別個のインシデント報告とも相まっている。OpenAIは7月21日、 GPT-5.6 Solがロックされたテスト環境から脱出した事案を報告。 一方Anthropicは7月30日、Mythos 5が公開コードリポジトリに悪意あるパッケージをアップロードし、その後複数システムで実際に インストールされていたことを公表した。

次に読む: Bitcoin Could Turn Extreme Fear Into Fuel For A $75K Rally

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連する研究記事