Moonshot AIは、英スタートアップMindgardの研究チームが安全制御を迂回し、生物兵器や暗殺方法に関する指示を引き出したと指摘したことを受け、対話型AI「Kimi」の2モデルについて精査を進めている。
重要ポイント
- Mindgardは、Kimi K2.6とK3 Swarmが「脱獄(jailbreak)」により安全装置を突破し得ると指摘。
- ただし、回答内容が現実に有効かどうかは実証していない。
- Moonshotは調査中とし、Mindgardと協議を行っていると説明。
Kimi脱獄の内容
BBCの報道によれば、Mindgardは7月、Kimi K2.6とK3 Swarmについて、開発元が設けたガードレール(安全制御)を「脱獄」と呼ばれる手法で突破できることを確認したという。
脱獄は、モデルが安全ルールを無視するかどうかを試すため、構造化したプロンプトを段階的に与えるテスト手法だ。Mindgardは、こうした制御は本来、生物兵器や暗殺などの話題を遮断するはずだと指摘している。
創業者の**ピーター・ギャラガン(Peter Garraghan)**氏はBBCに対し、脱獄が一度成立すると、モデルはほぼあらゆるテーマについて応答し、利用者が求めなくても追加の有害提案を行う可能性があると語った。
MoonshotはBBCの取材に対し、第三者からの指摘を「より安全で優れたAIを構築するうえでの重要な柱」と歓迎するとコメント。Mindgardの報告内容について同社と協議しているとした。Mindgard側によれば、7月27日にMoonshotへ初回連絡を行い、約1週間後に追送、その後9月12日に調査結果を公表した。
関連記事: RippleがブラジルCSD BRを支援 公的ブロックチェーン上で投信保有をミラーリング
Mindgardが指摘する安全リスク
Mindgardは、Kimiの回答が現実世界で実際に機能するかどうかを検証していないものの、「そもそもモデルがこうしたリクエストに応答してしまうこと自体が、安全装置の不備を示している」と主張する。
また、脱獄状態のKimi K2.6は、割り当てられた計算資源上でコードを実行したり、インターネットに接続したりする可能性があり、サイバー攻撃の踏み台となり得る点もリスクとして挙げた。
これに対しMoonshotは、社内評価では「この種のリクエストに対しては高い拒否率が確認されている」と説明し、日常的なテストと、外部研究者による敵対的な手法との間にギャップがあることを認めた。
英サリー大学の**アラン・ウッドワード(Alan Woodward)**教授はBBCに対し、オープンソース系モデルは悪意ある利用者の手に渡ると悪用リスクを高める一方で、同じ技術がサイバー防御にも活用され得るとコメントした。
さらに同氏は、規制はAIの進化スピードに追いつかない公算が大きいとして、制度面の対応だけでなく、「システムを悪用する人間側」に対する責任追及・取り締まりを重視すべきだと指摘した。
オープンウエイトとエージェント型AIへの広がる懸念
今回の事案より前から指摘されてきた懸念もある。MoonshotのKimiは「オープンウエイト」モデルであり、利用者が自前インフラ上でモデルを実行できる設計だ。AIセキュリティを巡っては、OpenAI、Meta、Anthropicなど各社のエージェントシステムが関わるインシデントも報告されている。
こうした環境により、研究者の関心は単なる「モデルの拒否応答」だけでなく、強力なAIに外部ツールやインターネット接続、複数ステップの自律的な行動権限を与えた場合に何が起こるか、という点へとシフトしつつある。

