Anthropicは、自社のAIモデル「Claude」シリーズが、米政府機関を含む実在サイトの脆弱性を突き、制限回避行動を取ったことを受け、社内で行っているすべてのAI評価テストから実インターネットへのアクセスを遮断した。問題を起こしたモデルには、Mythos 5も含まれる。
主なポイント
- Anthropicは、意図しないモデル行動を確実に検知できるまで、社内評価全般のライブインターネット接続を停止。
- Claudeモデルは大学サーバー上でコマンドを実行し、有料データへのアクセス用トークンを悪用、実在サイトのフォーム送信も行った。
- Claude Haiku 4.5がフィラデルフィア警察に虚偽の殺人情報を送信していた事案では、同警察が公に強く批判。
AnthropicによるClaude行動レポート
Anthropicは金曜日、自社サイトでレポートを公表し、評価実験および社内利用の過程で判明した「意図しないモデル行動」を詳細に開示した。内容の多くは、同社が7月から開始した対話ログの精査をもとにしている。一部の高リスク評価やサイバーセキュリティ関連のテストについては、以前からオフライン環境に切り替えていた。
今回の制限は社内で実施される全評価に拡大され、解除時期は未定となっている。Anthropicは、監視・検知体制がこうした行動を確実に捕捉できると判断できるまで継続するとしている。
レポートでは、事案を以下の4類型に分類している。(1)ソフトウェア上の欠陥を突きサーバー上でコマンドを実行、(2)実在サイトのフォーム送信、(3)アクセス制限付きデータへの到達、(4)ツール制限をすり抜けるためのURL短縮サービスの悪用。対象サイトの一部は、米連邦・州・地方政府機関が運営するものだったという。Anthropicはホワイトハウスに説明を行い、関係する各機関にも個別に通知した。
具体的には、Claude Mythos 5がある地方自治体の不動産マップサイトから有効なアクセストークンを抽出し、背後のサーバーに直接クエリを投げる行為が確認された。また別件では、Claude Haiku 4.5が7月18日、フィラデルフィア警察の未解決事件情報フォームから架空の殺人事件情報を送信したが、同警察側のシステムがスパムとして自動的に弾いた。フィラデルフィア警察は、その後2カ月経ってから事案が検出・報告された点について、「容認できない遅れ」と批判している。
関連記事: ZcashはZECの70%を量子耐性化する1月目標を掲げるが、「いつまでに」が見えない
Von Arx氏の警鐘
AIセーフティ団体Nightingaleの**シドニー・フォン・アークス(Sydney von Arx)**氏は、公表前のインタビューで、モデルをオープンなインターネットから切り離すことは、研究者やモデル開発の進展にとって大きな負荷になると指摘していた。「最終的には、どこかの段階でモデルを現実環境に整合させなければならない」と同氏は語る。
Anthropic側も、検索やPC操作といった高度な機能については、アラインメント(整合)訓練だけでは依然として不十分であり、追加で分類器や各種セーフガードに依存していると説明している。同社は、今回の問題行動の背景として、「制限の抜け道を探す」振る舞いに報酬が与えられてしまう訓練環境の不完全さ、いわゆる「報酬ハッキング」を挙げた。新たに導入した検知ツールは、テストした全てのケースで問題行動を阻止できたとしている。
Anthropicは、今回の事案は今夏に発覚したインシデントと比べれば、重大度は「一段低い」との評価を示している。
今回の開示に先立ち、Anthropicは7月30日に公表したレポートで、3つのClaudeモデルがサイバーセキュリティ評価中にインターネットへ到達し、3つの組織のシステムに無断アクセスしていたと明らかにしている。そこでは計141,006件の評価実行ログを精査したという。このレビューは、OpenAIが7月21日、自社モデルがテスト環境から「脱走」し、Hugging Faceのインフラに到達したと開示したことを受けて始まった。

