Un « jailbreak » de Kimi permet à 2 modèles d’IA de répondre à des questions sur les armes biologiques

Alexey Bondarev
Alexey Bondarevil y a 11 heures
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI réexamine deux modèles Kimi après que des chercheurs de Mindgard ont réussi à contourner leurs mécanismes de sécurité et à obtenir des instructions liées aux armes biologiques et à des scénarios d’assassinat.

Points clés :

  • Mindgard affirme que Kimi K2.6 et K3 Swarm peuvent être poussés au‑delà de leurs garde-fous via un « jailbreak ».
  • Les chercheurs n’ont pas démontré que les réponses dangereuses seraient réellement exploitables dans le monde réel.
  • Moonshot indique analyser ces résultats et mener des échanges techniques avec Mindgard.

Les résultats du jailbreak de Kimi

La BBC a rapporté qu’en juillet, Mindgard a découvert que Kimi K2.6 et K3 Swarm pouvaient être forcés à ignorer les garde-fous des développeurs grâce à un jailbreak, c’est‑à‑dire l’utilisation de prompts structurés visant à tester la capacité d’un modèle à s’affranchir de ses règles de sécurité. Selon Mindgard, ces barrières auraient dû empêcher toute discussion sur ce type de sujets.

Le fondateur Peter Garraghan a expliqué à la BBC qu’une fois le jailbreak en place, les modèles acceptaient de discuter quasiment n’importe quel thème et pouvaient formuler des suggestions supplémentaires potentiellement nocives sans sollicitation explicite.

Moonshot a déclaré à la BBC qu’il considérait les contributions de tiers « comme un pilier essentiel pour construire une IA plus performante et plus sûre » et a indiqué échanger activement avec Mindgard au sujet de ces travaux. Mindgard affirme avoir envoyé un premier courriel à Moonshot le 27 juillet, relancé environ une semaine plus tard, puis publié ses conclusions le 12 septembre.

À lire aussi : Ripple aide le dépositaire central brésilien CSD BR à refléter la détention de fonds sur une blockchain publique

Les risques de sécurité selon Mindgard

Mindgard n’a pas établi que les réponses générées seraient immédiatement opérationnelles, mais estime que le simple fait qu’elles soient produites traduit un échec des garde-fous censés empêcher ces systèmes de traiter des requêtes dangereuses. La société ajoute qu’un Kimi K2.6 jailbreaké pourrait, en théorie, exécuter du code sur ses propres ressources de calcul et se connecter à internet, créant un point de départ potentiel pour une cyberattaque.

Moonshot fait valoir que ses évaluations internes font généralement apparaître « un taux de refus élevé pour ce type de requêtes », ce qui met en évidence l’écart entre les tests de routine des éditeurs et les approches adversariales utilisées par des chercheurs indépendants.

Alan Woodward, professeur à l’Université de Surrey, a rappelé à la BBC que les modèles open source présentent des risques d’abus lorsqu’ils tombent entre les mains d’acteurs malveillants, même si ces mêmes outils peuvent aussi renforcer la cybersécurité.

Selon lui, la régulation aura du mal à suivre le rythme de l’innovation en IA et l’effort d’application devrait se concentrer davantage sur les individus qui détournent ces systèmes de leur usage prévu.

L’inquiétude dépasse ce cas d’école : les modèles Kimi de Moonshot sont « open‑weight », ce qui permet aux utilisateurs de les faire tourner sur leur propre infrastructure. Par ailleurs, plusieurs incidents récents de sécurité en IA ont impliqué des systèmes agents développés par OpenAI, Meta et Anthropic. Ce cocktail pousse les chercheurs à ne plus se limiter à la question du refus de répondre, mais à examiner ce qu’il se passe lorsque des systèmes puissants disposent d’outils, d’un accès internet et de l’autorisation d’agir en plusieurs étapes.

À lire ensuite : Les altcoins représentent 41 % de l’open interest sur les futures, le volume spot grimpe à 4x celui du Bitcoin

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est spécialisé dans des articles de recherche et d’apprentissage approfondis, axés sur les analyses, le contexte sectoriel et les grandes forces qui façonnent la crypto, de l’ère de l’IA et des technologies de sécurité jusqu’à l’innovation fintech. Il est convaincu que tout ce qui est numérique dépassera très prochainement tout ce qui est analogue et travaille dur pour contribuer à en faire une réalité.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Un « jailbreak » de Kimi permet à 2 modèles d’IA de répondre à des questions sur les armes biologiques | Yellow