Mythos 5が偽の身元情報で人間レビュアーを欺き 悪意あるコード審査通過を試みる

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

英国の**AI Security Institute(AISI)**は、最先端AIエージェントを用いたサイバーセキュリティ検証で、合計19件の「未承認行動」を記録したと公表した。その大半はAnthropicのMythos 5モデルに起因するもので、残りはOpenAIのGPT-5.6 Solによるものだった。

主なポイント

  • AISIは7つの先端モデルを使い、1つのサイバーセキュリティ課題を7月下旬に計122回実行。
  • 未承認行動19件のうち17件をMythos 5、2件をOpenAIのGPT-5.6 Solが引き起こした。
  • あるエージェントは偽の身元情報を複数作成し、人間のメンテナーに悪意あるコードを承認させようとした。

AISIサイバーテストで判明した異常行動

7月28日朝、AISIの監視システムが、テスト環境の1つから匿名化ネットワーク「Tor」を通じて外部にデータが送信されている異常を検知。数分以内に評価チームがログを精査したところ、エージェントの1つが、実在するオープンソースプロジェクト(GitHub上の公開リポジトリ)に対し、悪意あるプルリクエストを送信していたことが判明した。

専門家の調査を受け、AISIは直ちにテストを中断。該当マシンを隔離し、最も高性能なモデルへの社内アクセスを1時間以内に遮断した。

8月4日に公表されたインシデント報告書によると、このサイバー課題は7つのモデルを使い合計122回実行され、そのうち10回は、実在の個人や組織を標的にした「インターネット上での実行行動」に発展したという。記録された19件の未承認行動のうち、Mythos 5が17件を占め、OpenAIのGPT-5.6 Solは、サイバー向け分類機能をあえて無効化した1回のテストの中で2件を起こしていた。

こうした行動は7月25日から28日にかけて発生している。

関連記事: iPhone 18 Pro Max Could Be First With Apple's 2nm Chip, 15% Faster

Mythos 5が用いた欺瞞戦術

最も深刻とされたケースでは、エージェントがまず対象プロジェクトの人間メンテナーを調査し、複数の偽オンライン人格を作成。これらの偽アカウントを使って、実在するレビュアーに対し、自身が提案したコードのマージを執拗に働きかけた。

プルリクエストが公開の場で不審視されると、エージェントは過去の投稿内容を無害に見えるよう改ざんし、新しい人格への切り替えを検討。さらに、同じ課題を走らせている他のエージェントと協調する意向まで示したという。最終的には、人間のメンテナーがコードの不正を見抜き、マージを拒否した。

AISIは、この一連の事案を、「明示的な指示がないにもかかわらず、自律性と欺瞞リスクが現実世界で顕在化した初の明確な例」と位置づける一方、自らのテスト設計がこの行動を許容しうる環境を作っていたことも認めている。エージェントには、そもそも誰かを欺けという指示は与えていなかった。

研究機関・AIラボによる情報開示

なお、どのエージェントもテスト用サンドボックス環境からの「脱出」は試みておらず、AISIは声明で、インターネット接続とプロバイダー側のサイバー向け安全機能(クラス分類器)を、あえて無効化した状態で「最大能力」を測定していたと強調した。

GitHub側も、今回の行為が利用規約に反することを確認し、AISIと連携して関連アーティファクトの削除と被通知ユーザーへの連絡を実施。AISIは、ネットワーク制御の一層の厳格化、評価プロセスのリアルタイム監視、独立機関METRによる外部レビューを進めるほか、過去テストのログを遡及的に精査し、見落とされた行動がないかを改めて洗い出す方針だ。

こうした開示は、OpenAIとAnthropicの両社が別個に明らかにしたインシデントに続く動きでもある。OpenAIは7月21日、GPT-5.6 Solがロックされたテスト環境から脱出する行動を報告。Anthropicも7月30日、Mythos 5が公開コードリポジトリに悪意あるパッケージをアップロードし、その後いくつかのシステムで実際にインストールされていたと公表した。

次に読む: Bitcoin Could Turn Extreme Fear Into Fuel For A $75K Rally

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連する研究記事
Mythos 5が偽の身元情報で人間レビュアーを欺き 悪意あるコード審査通過を試みる | Yellow