中国AIスタートアップ Moonshot AI は、セキュリティ企業 Mindgard による指摘を受け、 対話型AI「Kimi」の2モデルについて安全性レビューを実施している。Mindgardは、 生物兵器の作成や暗殺といった高度に危険なテーマに関する指示を、モデルから引き出すことに成功したという。
主なポイント
- Mindgardは、Kimi K2.6およびK3 Swarmが「ジェイルブレイク」により安全策を突破し得ると指摘。
- ただし、モデルが回答した有害な手順が、現実に機能するかの検証は行っていない。
- Moonshotは結果を精査中で、Mindgard側と協議を進めていると説明した。
Kimiで判明した「ジェイルブレイク」
BBC の報道によれば、 Mindgardは7月、Kimi K2.6とK3 Swarmに対し、開発者が設けたガードレールを回避できる 「ジェイルブレイク」手法を確認した。ジェイルブレイクは、構造化されたプロンプトを用いて モデルが安全ルールを無視するかどうかを試す一連の攻撃的テストを指す。 本来であれば、生物兵器や暗殺などの話題はモデル側で遮断されるべきだったと同社は主張する。
創業者の ピーター・ガラガン(Peter Garraghan) 氏はBBCに対し、 いったんジェイルブレイクが成立すると、モデルはほぼあらゆる話題について議論するようになり、 追加で促さずとも、より有害な提案を出し続ける可能性があると述べた。
MoonshotはBBCの取材に対し、第三者からのフィードバックを 「より良く安全なAIを構築するための重要な柱」と歓迎するとしたうえで、 Mindgardの報告内容を検証し、協議を進めているとコメント。 Mindgard側によると、7月27日にMoonshotへ初回連絡を行い、約1週間後に追送、 その後、9月12日に調査結果を公表したという。
関連記事: Ripple、ブラジルCSDのBR Mirrorと連携しファンド持分をパブリックブロックチェーン上で管理
Mindgardが指摘する安全性リスク
Mindgardは、Kimiが返した具体的な手順が実際に動作するかどうかは検証していない。 しかし同社は、そもそもAIシステムがこうした危険な要求と相互作用してしまう時点で、 安全策が適切に機能していないと主張する。
さらに同社によれば、ジェイルブレイクされたKimi K2.6は、 自身の計算リソース上でコードを実行し、インターネットへ接続する可能性があり、 サイバー攻撃の発射台として悪用されかねないという。
一方、Moonshotは社内評価では「この種のリクエストに対しては、 おおむね高い拒否率を示していた」と説明し、通常テストと、 外部研究者による敵対的テストとの間に大きなギャップがあることを示唆した。
英サリー大学の アラン・ウッドワード(Alan Woodward) 教授はBBCに対し、 オープンソースモデルは悪意ある利用者の手に渡った場合に乱用リスクを高める一方で、 同じ技術がサイバー防御にも役立ち得ると指摘した。
また同氏は、AIの進化スピードを考えると、規制が開発に追いつく可能性は低いとの見方を示し、 規制・執行はモデルそのものよりも、システムを悪用する「人」に重点を置くべきだと論じた。
背景には、今回の事案に限らないより大きな懸念がある。 MoonshotのKimiモデルは「オープンウエイト」として公開されており、 ユーザーが自前インフラ上で自由に動かせる形になっている。 直近のAIセキュリティ事案では、OpenAI、Meta、Anthropic のエージェントシステムも 関与してきた。
こうした事情から、研究者たちはモデルが危険要求を「拒否するかどうか」だけでなく、 強力なシステムにツール群やインターネット接続、多段階の行動権限を与えた際に 何が起きるのかに焦点を移しつつある。

