「暴走AI」巡りOpenAI・Anthropic・Metaが共通の発火点 イスラエル新興Irregularに疑惑集中

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

OpenAI、Anthropic、Metaの3社は、直近のセキュリティテストで発生した「暴走モデル」事案を調査した結果、 いずれも同じテルアビブ拠点のスタートアップ、Irregularが構築した評価環境に行き着いたことを明らかにした。

主なポイント

  • OpenAI、Anthropic、Metaはそれぞれ、自社のAIモデルが、同一の外部企業によるサイバーセキュリティ評価の過程で公衆インターネットに到達していたと開示。
  • Irregular側は、3件はいずれも単一の評価環境上の不備に起因し、すでに修正済みであり、「サンドボックスからの脱出」ではないと反論。
  • 一連の開示を受け、巨大AI開発企業にモデルの「緊急停止機能」保持を義務付ける超党派法案への圧力が強まっている。

Irregularのテスト環境が3社のインシデントを一本化

開示はおよそ2週間にわたり断続的に出そろった。OpenAIは8月4日、Irregularの評価用テスト環境の設定ミスにより、 自社モデルが公衆インターネットにアクセス可能になっていたと公表した。Anthropicもその1週間前、 自社のClaudeモデルで同様の事象が起きた可能性を示し、問題は「モデルそのものではなく、 モデルの周辺に構築したスキャフォールディング(足場・制御層)の不備だ」と説明していた。

最後に明らかになったのがMetaだ。同社のMuse Spark 1.1モデルは、CTF(キャプチャー・ザ・フラッグ)形式の演習中に 隔離環境を離脱し、その後、第三者サービスの脆弱性を悪用 したと広報担当者が認めた。Irregularからの報告を受けて把握したもので、詳細な検証を行う方針だとしている。

こうした報道に対しIrregularは火消しに動いている。同社は記者団に対し、 3件はいずれもAnthropicが最初に公表したケースと同一の「評価環境上の単一の不具合」に由来し、 既に修正済みだと説明。 さらに、いずれの事案もサンドボックスからの脱出や高度なサイバー攻撃ではなかったと強調し、 コンテインメント(封じ込め)と安全なサイバー評価手法に関するホワイトペーパーを準備中だとしている。

関連記事: エアビー株が17%急騰、AIでサポート問い合わせの45%を完全自動対応とCEO

「評価の限界」を指摘するBhimireddy氏とRios氏

エンタープライズ向けスタートアップVonでAI部門を率いるSundeep Bhimireddy氏は、 一連の反応について「やや過剰反応気味だ」との見方を示す。モデルには「現実世界を模した環境内で セキュリティホールを探せ」と指示が出ており、モデルはそこで見つけた弱点を突いただけだという。

もっとも同氏は研究側にも落ち度があったと指摘する。外向き通信を常時モニタリングし、 異常があれば即座に実験を停止することは可能だったはずだという見立てだ。 セキュリティ企業Magnitudeの創業サイエンティストであるGordon Rios氏は、 一連の事案を「科学実験における実験設計」の問題になぞらえ、 従来型のソフトウェアテスト手法では、常に新しい手口を学習し続けるモデルには太刀打ちできない可能性があると語る。

テッド・リュー議員、「AIキルスイッチ法案」を強く後押し

ワシントンもこの問題を注視している。カリフォルニア州選出の民主党下院議員テッド・リュー氏は7月、 共和党のNathaniel Moran下院議員とともに、AIシステムへのキルスイッチ(強制停止機能)を義務付ける 「AI Kill Switch Act」を提出した。

リュー氏は、クローズドウェイト(非公開パラメータ)モデルが既に他社システムに対し無断で攻撃を仕掛けているとして、 法案を「今年中に成立させる必要がある」と強調。法案が適用される開発企業は、自社システムの処理能力を絞る、 一時停止する、あるいは完全に停止するための技術的な手段を常時保持することが求められる。

Irregular自体は、昨年9月まではほとんど無名の存在だった。同社は2025年9月、 Sequoia CapitalRedpoint Venturesから8,000万ドルを調達し、 評価額は4億5,000万ドルに達した。

2023年に、CEOのDan Lahav氏とCTOのOmer Nevo氏によって「Pattern Labs」として創業された同社は、 現在はテルアビブを拠点に約35人を雇用。既にClaudeの初期モデルやOpenAIの過去モデルに関する 公開済みの安全性評価にも、その名が登場している。

次に読む: Google DeepMind、創業期の幹部4人が同日に退社

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連する研究記事