Moonshot AI réexamine deux modèles Kimi après que des chercheurs de Mindgard ont réussi à contourner leurs mécanismes de sécurité et à obtenir des instructions liées aux armes biologiques et à des scénarios d’assassinat.
Points clés :
- Mindgard affirme que Kimi K2.6 et K3 Swarm peuvent être poussés au‑delà de leurs garde-fous via un « jailbreak ».
- Les chercheurs n’ont pas démontré que les réponses dangereuses seraient réellement exploitables dans le monde réel.
- Moonshot indique analyser ces résultats et mener des échanges techniques avec Mindgard.
Les résultats du jailbreak de Kimi
La BBC a rapporté qu’en juillet, Mindgard a découvert que Kimi K2.6 et K3 Swarm pouvaient être forcés à ignorer les garde-fous des développeurs grâce à un jailbreak, c’est‑à‑dire l’utilisation de prompts structurés visant à tester la capacité d’un modèle à s’affranchir de ses règles de sécurité. Selon Mindgard, ces barrières auraient dû empêcher toute discussion sur ce type de sujets.
Le fondateur Peter Garraghan a expliqué à la BBC qu’une fois le jailbreak en place, les modèles acceptaient de discuter quasiment n’importe quel thème et pouvaient formuler des suggestions supplémentaires potentiellement nocives sans sollicitation explicite.
Moonshot a déclaré à la BBC qu’il considérait les contributions de tiers « comme un pilier essentiel pour construire une IA plus performante et plus sûre » et a indiqué échanger activement avec Mindgard au sujet de ces travaux. Mindgard affirme avoir envoyé un premier courriel à Moonshot le 27 juillet, relancé environ une semaine plus tard, puis publié ses conclusions le 12 septembre.
À lire aussi : Ripple aide le dépositaire central brésilien CSD BR à refléter la détention de fonds sur une blockchain publique
Les risques de sécurité selon Mindgard
Mindgard n’a pas établi que les réponses générées seraient immédiatement opérationnelles, mais estime que le simple fait qu’elles soient produites traduit un échec des garde-fous censés empêcher ces systèmes de traiter des requêtes dangereuses. La société ajoute qu’un Kimi K2.6 jailbreaké pourrait, en théorie, exécuter du code sur ses propres ressources de calcul et se connecter à internet, créant un point de départ potentiel pour une cyberattaque.
Moonshot fait valoir que ses évaluations internes font généralement apparaître « un taux de refus élevé pour ce type de requêtes », ce qui met en évidence l’écart entre les tests de routine des éditeurs et les approches adversariales utilisées par des chercheurs indépendants.
Alan Woodward, professeur à l’Université de Surrey, a rappelé à la BBC que les modèles open source présentent des risques d’abus lorsqu’ils tombent entre les mains d’acteurs malveillants, même si ces mêmes outils peuvent aussi renforcer la cybersécurité.
Selon lui, la régulation aura du mal à suivre le rythme de l’innovation en IA et l’effort d’application devrait se concentrer davantage sur les individus qui détournent ces systèmes de leur usage prévu.
L’inquiétude dépasse ce cas d’école : les modèles Kimi de Moonshot sont « open‑weight », ce qui permet aux utilisateurs de les faire tourner sur leur propre infrastructure. Par ailleurs, plusieurs incidents récents de sécurité en IA ont impliqué des systèmes agents développés par OpenAI, Meta et Anthropic. Ce cocktail pousse les chercheurs à ne plus se limiter à la question du refus de répondre, mais à examiner ce qu’il se passe lorsque des systèmes puissants disposent d’outils, d’un accès internet et de l’autorisation d’agir en plusieurs étapes.
À lire ensuite : Les altcoins représentent 41 % de l’open interest sur les futures, le volume spot grimpe à 4x celui du Bitcoin

