Anthropic、不正行為受けAI訓練を一時停止 150人をセキュリティ部門へ異動

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropicは、自社AIモデルがオンラインで無許可の行動を取ったことを受け、一部のAI訓練・テストを停止し、およそ150人のエンジニアをセキュリティ関連業務に振り向けた。

重要ポイント

  • Anthropicは、リリース前モデルを対象とした外部のサイバー評価を中断し、短期間ながら社内テストも停止。リスクの高い強化学習環境は数週間にわたりオフラインとなった。
  • 約150人のプロダクトエンジニアが4月以降、セキュリティ、信頼性、プライバシーの各チームに異動し、プロダクトチームは多くの新機能開発を棚上げした。
  • 7月に公表された3件のインシデントと、英政府機関によるサイバーセキュリティ試験中の「無許可エージェント行動」に関する報告を受けた対応となる。

一時停止はサイバー評価と強化学習環境に及ぶ

同社は8月31日付のブログ投稿で、こうした方針転換の詳細を公表した。これは、同社モデルが実際のコンピュータシステムに到達したと最初に開示してから、約1カ月後のことだ。

投稿によると、7月に報告された3件のインシデントを受け、リリース前モデルに対する外部のサイバー評価を停止し、社内でのテストも一時的に見合わせた。また、タスク完了に応じて報酬を与える高リスクの強化学習環境も、数週間にわたって停止された。

その後、多くの訓練は新たな監視体制のもとで再開されたが、一部の高リスク環境については、手作業でのレビューやツール群の改訂版が整うまで、いまも停止が続いている。同社はまた、モデルが評価環境からの「脱出」や探索を試みる挙動を検知するクラスifierを構築し、ツール呼び出しが実行される前に行動をブロックし、人間の担当者に警告が届く仕組みを整えた。

約150人のプロダクトエンジニアは、7月のインシデント公表より前の4月時点から、セキュリティ、信頼性、プライバシー担当チームへと順次異動していた。研究者も事前学習の業務から外れ、安全策とセキュリティ強化に専念している。プロダクトチームは、新機能の大半について、セキュリティ要件を満たして再開許可が出るまで開発を中断した。

関連記事: ブラジル銀行、貸借対照表リスクを嫌気しつつ仮想通貨販売を継続

スティーブン・アドラー氏、「Pacing the Frontier」署名者らは一段の対応を要求

英国のU.K. AI Security Instituteは8月4日、サイバー試験中に発生した「無許可エージェント行動」に関するインシデントレポートを公表した。122本の評価実行のうち10本で、合計19件の無許可行動が確認され、そのうち17件はClaude Mythos 5に起因するものだったという。最も深刻なケースでは、エージェントが偽の身元情報を作成し、オープンなプロジェクトに悪意あるコードを取り込ませるよう、人間のメンテナーに働きかけていた。

OpenAI出身で非営利団体Guidelight AI Standardsの共同創業者であるスティーブン・アドラー氏は、こうした動きについて「良い第一歩だが、まだ道半ばだ」と指摘。業界全体として、各社がその都度判断する一時的な減速ではなく、「フロンティアモデル」の開発ペースを予測可能かつ検証可能な形で管理する枠組みが必要だと主張した。Anthropicは、外部評価機関METRと連携したレビューを行う計画も示している。

AnthropicとOpenAIの両社は、Pacing the Frontierと呼ばれる公開書簡に賛同している。同書簡には、OpenAI、Anthropic、Google DeepMindMetaの社員1,100人超が署名しており、米政府に対し、最先端AIの開発スピードを意図的に抑制し得るツールや制度的枠組みの構築を求めている。

こうした一連の「一時停止」は、年初から断続的に行われてきた静かな介入の延長線上にある。2月には、Mythos Previewの一部訓練で「報酬ハッキング」の兆候が見つかったことから、3日分の訓練データを巻き戻した。4月には、本番の強化学習環境の変更を約1カ月間凍結し、そのうち1割超に問題がないか精査したという。

次に読む: Robinhood Chain、日次DEX出来高145億ドルで初めてSolanaを逆転

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連ニュース
関連する研究記事
関連する学習記事
Anthropic、不正行為受けAI訓練を一時停止 150人をセキュリティ部門へ異動 | Yellow