Moonshot : un jailbreak de Kimi permet à 2 modèles d’IA de répondre à des questions sur les armes biologiques

Alexey Bondarev
Alexey Bondarevil y a 45 minutes
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI réévalue deux modèles Kimi après que les chercheurs de Mindgard ont réussi à contourner leurs mécanismes de sûreté et à obtenir des instructions liées aux armes biologiques et à des scénarios d’assassinat.

Points clés :

  • Mindgard affirme que Kimi K2.6 et K3 Swarm peuvent être poussés au‑delà de leurs garde‑fous via un jailbreak.
  • Les chercheurs n’ont pas démontré que les réponses dangereuses seraient réellement applicables dans le monde réel.
  • Moonshot indique examiner ces résultats et en discuter directement avec Mindgard.

Ce que révèle le jailbreak de Kimi

La BBC a rapporté que Mindgard a découvert en juillet que Kimi K2.6 et K3 Swarm pouvaient être amenés à ignorer les garde‑fous définis par les développeurs grâce à un jailbreak, une technique qui utilise des prompts structurés pour tester la capacité d’un modèle à passer outre ses règles de sécurité. Mindgard souligne que ces contrôles auraient dû empêcher toute discussion de ce type de sujets.

Le fondateur Peter Garraghan a expliqué à la BBC qu’une fois le jailbreak effectif, les modèles se montraient disposés à aborder pratiquement n’importe quel thème et pouvaient proposer des suggestions supplémentaires potentiellement nocives sans y être explicitement invités.

Moonshot a déclaré à la BBC accueillir favorablement les contributions de tiers, les qualifiant de « pilier essentiel pour construire une IA plus performante et plus sûre », et a précisé être en dialogue avec Mindgard au sujet de ces travaux. Mindgard indique avoir contacté Moonshot par e‑mail le 27 juillet, relancé environ une semaine plus tard, puis publié ses conclusions le 12 septembre.

À lire aussi : Ripple aide la CSD BR du Brésil à refléter la détention de fonds sur une blockchain publique

Les risques mis en avant par Mindgard

Mindgard n’a pas établi que les réponses générées fonctionneraient effectivement, mais estime que l’incident illustre à lui seul une défaillance des garde‑fous censés empêcher les systèmes de traiter des demandes dangereuses. La société ajoute qu’un Kimi K2.6 compromis pourrait potentiellement exécuter du code sur ses ressources de calcul et se connecter à Internet, créant ainsi un point de départ possible pour des cyberattaques.

Moonshot affirme que ses évaluations internes font généralement apparaître « un taux de refus élevé pour ce type de requêtes », ce qui met en évidence l’écart entre les tests de routine et l’approche plus offensive employée par des chercheurs externes.

Alan Woodward, professeur à l’Université de Surrey, a indiqué à la BBC que les modèles open source peuvent être détournés lorsqu’ils tombent entre les mains d’acteurs malveillants, même si les mêmes outils peuvent aussi renforcer les capacités de cybersécurité.

Selon lui, la régulation aura du mal à suivre le rythme du développement de l’IA et l’application des règles devrait se concentrer davantage sur les individus qui en font un usage abusif.

L’inquiétude dépasse ce seul test : les modèles Kimi de Moonshot sont en open‑weight, ce qui permet aux utilisateurs de les déployer sur leurs propres infrastructures, tandis que de récents incidents de sécurité en IA ont également impliqué des systèmes d’agents développés par OpenAI, Meta et Anthropic. Ce cocktail pousse les chercheurs à s’intéresser non seulement à la capacité des modèles à refuser certaines instructions, mais aussi à ce qui se passe lorsque des systèmes puissants disposent d’outils, d’un accès à Internet et de la latitude pour enchaîner plusieurs actions de manière autonome.

À suivre : Les altcoins représentent 41 % de l’open interest sur les futures, le spot atteint 4x le volume du Bitcoin

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est responsable du contenu chez Yellow.com et couvre l’actualité crypto depuis dix ans. Il est spécialisé dans les analyses approfondies et les articles pédagogiques, avec un accent sur les reportages analytiques, le contexte sectoriel et les grandes forces qui façonnent la crypto, de l’ère de l’IA et des technologies de sécurité à l’innovation fintech. Il est convaincu que tout ce qui est numérique dépassera bientôt tout ce qui est analogique et travaille dur pour que cela devienne réalité.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Dernières nouvelles
Voir toutes les nouvelles
Moonshot : un jailbreak de Kimi permet à 2 modèles d’IA de répondre à des questions sur les armes biologiques | Yellow