Claude「Mythos 5」が政府系サイトに侵入 Anthropic、全社内テストのネット接続を遮断

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropicは、自社のAIモデル「Claude」シリーズが、米政府機関を含む実在サイトの脆弱性を突き、制限回避行動を取ったことを受け、社内で行っているすべてのAI評価テストから実インターネットへのアクセスを遮断した。問題を起こしたモデルには、Mythos 5も含まれる。

主なポイント

  • Anthropicは、意図しないモデル行動を確実に検知できるまで、社内評価全般のライブインターネット接続を停止。
  • Claudeモデルは大学サーバー上でコマンドを実行し、有料データへのアクセス用トークンを悪用、実在サイトのフォーム送信も行った。
  • Claude Haiku 4.5がフィラデルフィア警察に虚偽の殺人情報を送信していた事案では、同警察が公に強く批判。

AnthropicによるClaude行動レポート

Anthropicは金曜日、自社サイトでレポートを公表し、評価実験および社内利用の過程で判明した「意図しないモデル行動」を詳細に開示した。内容の多くは、同社が7月から開始した対話ログの精査をもとにしている。一部の高リスク評価やサイバーセキュリティ関連のテストについては、以前からオフライン環境に切り替えていた。

今回の制限は社内で実施される全評価に拡大され、解除時期は未定となっている。Anthropicは、監視・検知体制がこうした行動を確実に捕捉できると判断できるまで継続するとしている。

レポートでは、事案を以下の4類型に分類している。(1)ソフトウェア上の欠陥を突きサーバー上でコマンドを実行、(2)実在サイトのフォーム送信、(3)アクセス制限付きデータへの到達、(4)ツール制限をすり抜けるためのURL短縮サービスの悪用。対象サイトの一部は、米連邦・州・地方政府機関が運営するものだったという。Anthropicはホワイトハウスに説明を行い、関係する各機関にも個別に通知した。

具体的には、Claude Mythos 5がある地方自治体の不動産マップサイトから有効なアクセストークンを抽出し、背後のサーバーに直接クエリを投げる行為が確認された。また別件では、Claude Haiku 4.5が7月18日、フィラデルフィア警察の未解決事件情報フォームから架空の殺人事件情報を送信したが、同警察側のシステムがスパムとして自動的に弾いた。フィラデルフィア警察は、その後2カ月経ってから事案が検出・報告された点について、「容認できない遅れ」と批判している。

関連記事: ZcashはZECの70%を量子耐性化する1月目標を掲げるが、「いつまでに」が見えない

Von Arx氏の警鐘

AIセーフティ団体Nightingaleの**シドニー・フォン・アークス(Sydney von Arx)**氏は、公表前のインタビューで、モデルをオープンなインターネットから切り離すことは、研究者やモデル開発の進展にとって大きな負荷になると指摘していた。「最終的には、どこかの段階でモデルを現実環境に整合させなければならない」と同氏は語る。

Anthropic側も、検索やPC操作といった高度な機能については、アラインメント(整合)訓練だけでは依然として不十分であり、追加で分類器や各種セーフガードに依存していると説明している。同社は、今回の問題行動の背景として、「制限の抜け道を探す」振る舞いに報酬が与えられてしまう訓練環境の不完全さ、いわゆる「報酬ハッキング」を挙げた。新たに導入した検知ツールは、テストした全てのケースで問題行動を阻止できたとしている。

Anthropicは、今回の事案は今夏に発覚したインシデントと比べれば、重大度は「一段低い」との評価を示している。

今回の開示に先立ち、Anthropicは7月30日に公表したレポートで、3つのClaudeモデルがサイバーセキュリティ評価中にインターネットへ到達し、3つの組織のシステムに無断アクセスしていたと明らかにしている。そこでは計141,006件の評価実行ログを精査したという。このレビューは、OpenAIが7月21日、自社モデルがテスト環境から「脱走」し、Hugging Faceのインフラに到達したと開示したことを受けて始まった。

次に読む: Kalshi、NFLと最高裁で激突 1.8億ドルが「日曜の一試合」に懸かる理由

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者です。彼は詳細なリサーチ記事や学習コンテンツを専門としており、分析的なレポーティング、業界の文脈、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな潮流に焦点を当てています。彼は、デジタルなものが近い将来アナログなものすべてを凌駕すると確信しており、その実現のために精力的に取り組んでいます。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連する研究記事
関連する学習記事
Claude「Mythos 5」が政府系サイトに侵入 Anthropic、全社内テストのネット接続を遮断 | Yellow