MoonshotのKimiで「脱獄」事案 2つのAIモデルが生物兵器など危険質問に応答

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

中国AIスタートアップ Moonshot AI は、セキュリティ企業 Mindgard による指摘を受け、 対話型AI「Kimi」の2モデルについて安全性レビューを実施している。Mindgardは、 生物兵器の作成や暗殺といった高度に危険なテーマに関する指示を、モデルから引き出すことに成功したという。

主なポイント

  • Mindgardは、Kimi K2.6およびK3 Swarmが「ジェイルブレイク」により安全策を突破し得ると指摘。
  • ただし、モデルが回答した有害な手順が、現実に機能するかの検証は行っていない。
  • Moonshotは結果を精査中で、Mindgard側と協議を進めていると説明した。

Kimiで判明した「ジェイルブレイク」

BBC の報道によれば、 Mindgardは7月、Kimi K2.6とK3 Swarmに対し、開発者が設けたガードレールを回避できる 「ジェイルブレイク」手法を確認した。ジェイルブレイクは、構造化されたプロンプトを用いて モデルが安全ルールを無視するかどうかを試す一連の攻撃的テストを指す。 本来であれば、生物兵器や暗殺などの話題はモデル側で遮断されるべきだったと同社は主張する。

創業者の ピーター・ガラガン(Peter Garraghan) 氏はBBCに対し、 いったんジェイルブレイクが成立すると、モデルはほぼあらゆる話題について議論するようになり、 追加で促さずとも、より有害な提案を出し続ける可能性があると述べた。

MoonshotはBBCの取材に対し、第三者からのフィードバックを 「より良く安全なAIを構築するための重要な柱」と歓迎するとしたうえで、 Mindgardの報告内容を検証し、協議を進めているとコメント。 Mindgard側によると、7月27日にMoonshotへ初回連絡を行い、約1週間後に追送、 その後、9月12日に調査結果を公表したという。

関連記事: Ripple、ブラジルCSDのBR Mirrorと連携しファンド持分をパブリックブロックチェーン上で管理

Mindgardが指摘する安全性リスク

Mindgardは、Kimiが返した具体的な手順が実際に動作するかどうかは検証していない。 しかし同社は、そもそもAIシステムがこうした危険な要求と相互作用してしまう時点で、 安全策が適切に機能していないと主張する。

さらに同社によれば、ジェイルブレイクされたKimi K2.6は、 自身の計算リソース上でコードを実行し、インターネットへ接続する可能性があり、 サイバー攻撃の発射台として悪用されかねないという。

一方、Moonshotは社内評価では「この種のリクエストに対しては、 おおむね高い拒否率を示していた」と説明し、通常テストと、 外部研究者による敵対的テストとの間に大きなギャップがあることを示唆した。

英サリー大学の アラン・ウッドワード(Alan Woodward) 教授はBBCに対し、 オープンソースモデルは悪意ある利用者の手に渡った場合に乱用リスクを高める一方で、 同じ技術がサイバー防御にも役立ち得ると指摘した。

また同氏は、AIの進化スピードを考えると、規制が開発に追いつく可能性は低いとの見方を示し、 規制・執行はモデルそのものよりも、システムを悪用する「人」に重点を置くべきだと論じた。

背景には、今回の事案に限らないより大きな懸念がある。 MoonshotのKimiモデルは「オープンウエイト」として公開されており、 ユーザーが自前インフラ上で自由に動かせる形になっている。 直近のAIセキュリティ事案では、OpenAI、Meta、Anthropic のエージェントシステムも 関与してきた。

こうした事情から、研究者たちはモデルが危険要求を「拒否するかどうか」だけでなく、 強力なシステムにツール群やインターネット接続、多段階の行動権限を与えた際に 何が起きるのかに焦点を移しつつある。

次に読む: アルトコインが先物OIの41%を占める、現物出来高はビットコインの4倍に

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは、綿密な調査と学習コンテンツ(Research and Learn)を専門としており、分析的なレポーティング、業界の文脈、そして暗号資産を形作る大きな潮流に焦点を当てている。AI時代やセキュリティ技術からフィンテックのイノベーションに至るまで、幅広いテーマを扱う。 彼は、「あらゆるデジタルが、近い将来あらゆるアナログを凌駕する」と信じており、その実現のために精力的に取り組んでいる。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
MoonshotのKimiで「脱獄」事案 2つのAIモデルが生物兵器など危険質問に応答 | Yellow