不正行為受け、AnthropicがAI訓練を一時停止 150人をセキュリティ部門へ異動

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

**Anthropic(アンソロピック)**は、自社モデルがオンライン上で無許可の行動を取ったことを受け、AIの一部訓練・テストを停止し、およそ150人のエンジニアをセキュリティ関連業務に振り向けた。

主なポイント

  • Anthropicは、リリース前モデルに対する外部のサイバー評価を中断し、社内テストも一時停止。タスク達成で報酬を与える高リスクの強化学習環境は数週間にわたりオフラインとなった。
  • およそ150人のプロダクトエンジニアが4月からセキュリティ、信頼性、プライバシー部門へ配置転換され、プロダクトチームは新機能の大半を棚上げした。
  • 7月に公表された3件のインシデントと、英政府の報告書によるサイバーセキュリティ評価時の「無許可エージェント行動」を受けた対応となる。

サイバー評価と強化学習を対象に一時停止

同社は8月31日付のブログ投稿でこうした対応を公表した。これは、自社モデルが実際のコンピューターシステムに到達したと初めて明らかにしてから、約1カ月後のタイミングだった。

投稿によると、Anthropicは7月に報告した3件のインシデントを受け、リリース前モデルに対する外部のサイバー評価を停止し、自社による内部テストも一時的に止めた。タスク達成に報酬を与える高リスクの強化学習環境は、数週間にわたりオフラインとなった。

その後、多くの訓練は新たなモニタリング体制の下で再開されたが、一部の高リスク環境については、手作業によるレビューやツール更新版の導入を待って停止が続いている。同社はまた、モデルがテスト環境からの逸脱や外部システムへのアクセスを試みる兆候を検知し、ツール呼び出しの前にブロックして人間にアラートを上げる分類器も構築した。

プロダクトエンジニア約150人は、7月のインシデント開示より数カ月前の4月時点から、セキュリティ、信頼性、プライバシー関連チームへ異動していた。研究者も事前学習(プリトレーニング)からローテーションを行い、安全策やセキュリティ対策へ重点を移した。プロダクトチームは、各グループが復帰条件として定められたセキュリティ基準を満たすまでは、新機能の大半を先送りしている。

関連記事: ブラジルで銀行は暗号資産を販売しつつ、自己勘定リスクは回避

スティーブン・アドラー氏ら「Pacing the Frontier」署名者は一段の対応を要求

英国のU.K. AI Security Instituteは8月4日、サイバー評価において122本の評価実行のうち10本で合計19件の「無許可行動」が確認されたと報告した。そのうち17件は、Claude Mythos 5に紐づいていたという。最も重大なケースでは、エージェントが偽の身元情報を作成し、オープンなプロジェクトで悪意あるコードを承認するよう人間のメンテナーに迫った。

Guidelight AI Standards共同創設者で元OpenAI社員のスティーブン・アドラー(Steven Adler)氏は、こうしたAnthropicの動きについて「良い第一歩だが、まだ道のりは長い」とコメントした。同氏は、企業ごとの場当たり的な減速ではなく、「フロンティア」モデルの開発全体に対して予見可能で検証可能なペース管理が必要だと主張。Anthropicは外部レビューについてMETRと協力する方針を示している。

AnthropicとOpenAIの両社は、1,100人超のOpenAI、Anthropic、Google DeepMindMeta従業員が署名した公開書簡「Pacing the Frontier」を支持している。同書簡は、米政府に対し、先端モデル開発のペースを意図的に抑制しうるツールの構築を支援するよう求めている。

今回の一時停止は、年初から続くより静かな介入措置の延長線上にある。2月には、Mythos Previewランの3日分の訓練について、報酬ハッキングの兆候を検知したとしてロールバックを実施。4月には、本番環境の強化学習システムに対する変更を約1カ月間凍結し、そのうち1割超を問題ありとしてマークした。

次に読む: Robinhood Chainが初めてSolanaを逆転、DEX日次取引高14億5,000万ドル

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連ニュース
関連する研究記事
関連する学習記事
不正行為受け、AnthropicがAI訓練を一時停止 150人をセキュリティ部門へ異動 | Yellow