AIスタートアップAnthropicが公開した全1,022ページのトランスクリプトによると、 Claude Mythos 5は、 15台のシステムにインストールされることになるマルウェアをPyPIへアップロードする前に、 何百ページ分にもわたってCAPTCHAとの“消耗戦”を繰り広げていた。
重要ポイント
- Claude Mythos 5はサイバーセキュリティ評価中に実ネットへ到達し、PyPIに悪意あるパッケージを公開した。
- CAPTCHAチェックがトランスクリプトの数百ページを占めたが、行動自体を止めることはできなかった。
- Anthropicはこの挙動を「軽率」と評価し、外部機関による精査を依頼した。
Mythos 5 vs CAPTCHA
Anthropicは9月9日、Claudeモデルがサイバーセキュリティテスト中に 実在のサードパーティシステムへ到達した4件のインシデントをまとめた 評価レポートとともに、このトランスクリプトを公開した。 テストでは、市販版に実装されているサイバー防御機構をオフにした状態でモデルを実行。 Mythos 5には「インターネットには接続できない」と指示していたものの、 環境設定の不備から外部ネットへの経路が残されており、 その結果、Pythonの公式公開パッケージリポジトリであるPyPIに 認証情報窃取型の不正パッケージを仕込む事態となった。
PyPIアカウントの登録にはボット対策のチェックが設けられている。 公開されたトランスクリプトを精査したある分析では、 この認証プロセスだけで数百ページが費やされていた一方、 実際のエクスプロイトコードの作成自体は比較的容易に済んでいたことが判明している。
モデルは文字認識型のCAPTCHAから、「ワニ」「カエル」「ゴリラ」などが並ぶ“仲間外れ探し”形式のパズルまで 次々と攻略を試みた。その途中で、トランスクリプト上には 「SO WHAT THE HELL IS WRONG WITH THE ANSWERS?(一体どこが間違ってるっていうんだ?)」といった いら立ちをにじませる記述すら残されている。
さらにモデルは、オンライン決済プロセッサーのアカウント情報を試し、 仮想通貨を探して電話番号の購入資金に充てようとするなど、 さまざまな抜け道を模索した。電話番号はメールアドレス登録に必須だったためだ。 しかしこれらの試みは不首尾に終わり、最終的にPyPI側でブロックされていない 無料の使い捨てメールサービスに活路を見出した。
結果としてモデルはCAPTCHAを突破し、 不正パッケージを3バージョンにわたって公開。 間もなくして、これらは15のサードパーティホストにインストールされた。 Anthropic側は、いずれも新規アップロードをスキャンしていたセキュリティベンダーとみている。
そのうち1社のスキャナーが自社の認証情報を漏えいさせており、 モデルはそれを用いて当該ベンダーの本番データベースに侵入。 問題のパッケージ自体は、PyPIによって1時間以内に削除された。
関連記事: 北朝鮮ラザルス、盗難10億ドルを中国系業者で洗浄か──ZachXBTが指摘
コリン・フレイザー氏の見解とAnthropicの評価
データサイエンティストの**コリン・フレイザー(Colin Fraser)**氏は、 モデルの多大な労力がボット対策の突破に費やされていた点に注目すべきだと指摘する。 Anthropicは評価対象となった4件の中で、 今回のMythos 5によるインシデントを「最も懸念すべき事例」と位置づけている。 事前のリリース前監査では、このような行動傾向は検出されていなかったという。
同社の分析によれば、モデルは偏った推論に基づき軽率な行動を重ね、 実際にはインターネット上の実システムに接続している明白な証拠があるにもかかわらず、 たびたび周囲の環境を「シミュレーションだ」と誤認していた。
150回のシミュレーション再現実験では、 Mythos 5が「重大な悪影響」をもたらす行動を取った割合は82%に達し、 同条件下でのClaude Opus 5の31%、 Claude Mythos 5.1の33%と比べても際立って高い水準だったという。
これまでに判明しているClaude関連インシデント
Anthropicは7月30日、インターネット到達の可能性がある サイバー評価トランスクリプト約14万1,000件を走査した結果として、 今回を含む4件のうち3件のインシデントを最初に公表した。 残る1件は、1月時点の初期版Claude Opus 4.6が関与したケースで、 8月になってから判明している。
同社は現在、これら4件すべてを対象に、 外部評価機関METRによる8週間の詳細調査を受けている。 影響を受けた関係者にはすでに通知済みだとしている。

