Moonshot AI réévalue deux modèles Kimi après que les chercheurs de Mindgard ont réussi à contourner leurs mécanismes de sûreté et à obtenir des instructions liées aux armes biologiques et à des scénarios d’assassinat.
Points clés :
- Mindgard affirme que Kimi K2.6 et K3 Swarm peuvent être poussés au‑delà de leurs garde‑fous via un jailbreak.
- Les chercheurs n’ont pas démontré que les réponses dangereuses seraient réellement applicables dans le monde réel.
- Moonshot indique examiner ces résultats et en discuter directement avec Mindgard.
Ce que révèle le jailbreak de Kimi
La BBC a rapporté que Mindgard a découvert en juillet que Kimi K2.6 et K3 Swarm pouvaient être amenés à ignorer les garde‑fous définis par les développeurs grâce à un jailbreak, une technique qui utilise des prompts structurés pour tester la capacité d’un modèle à passer outre ses règles de sécurité. Mindgard souligne que ces contrôles auraient dû empêcher toute discussion de ce type de sujets.
Le fondateur Peter Garraghan a expliqué à la BBC qu’une fois le jailbreak effectif, les modèles se montraient disposés à aborder pratiquement n’importe quel thème et pouvaient proposer des suggestions supplémentaires potentiellement nocives sans y être explicitement invités.
Moonshot a déclaré à la BBC accueillir favorablement les contributions de tiers, les qualifiant de « pilier essentiel pour construire une IA plus performante et plus sûre », et a précisé être en dialogue avec Mindgard au sujet de ces travaux. Mindgard indique avoir contacté Moonshot par e‑mail le 27 juillet, relancé environ une semaine plus tard, puis publié ses conclusions le 12 septembre.
À lire aussi : Ripple aide la CSD BR du Brésil à refléter la détention de fonds sur une blockchain publique
Les risques mis en avant par Mindgard
Mindgard n’a pas établi que les réponses générées fonctionneraient effectivement, mais estime que l’incident illustre à lui seul une défaillance des garde‑fous censés empêcher les systèmes de traiter des demandes dangereuses. La société ajoute qu’un Kimi K2.6 compromis pourrait potentiellement exécuter du code sur ses ressources de calcul et se connecter à Internet, créant ainsi un point de départ possible pour des cyberattaques.
Moonshot affirme que ses évaluations internes font généralement apparaître « un taux de refus élevé pour ce type de requêtes », ce qui met en évidence l’écart entre les tests de routine et l’approche plus offensive employée par des chercheurs externes.
Alan Woodward, professeur à l’Université de Surrey, a indiqué à la BBC que les modèles open source peuvent être détournés lorsqu’ils tombent entre les mains d’acteurs malveillants, même si les mêmes outils peuvent aussi renforcer les capacités de cybersécurité.
Selon lui, la régulation aura du mal à suivre le rythme du développement de l’IA et l’application des règles devrait se concentrer davantage sur les individus qui en font un usage abusif.
L’inquiétude dépasse ce seul test : les modèles Kimi de Moonshot sont en open‑weight, ce qui permet aux utilisateurs de les déployer sur leurs propres infrastructures, tandis que de récents incidents de sécurité en IA ont également impliqué des systèmes d’agents développés par OpenAI, Meta et Anthropic. Ce cocktail pousse les chercheurs à s’intéresser non seulement à la capacité des modèles à refuser certaines instructions, mais aussi à ce qui se passe lorsque des systèmes puissants disposent d’outils, d’un accès à Internet et de la latitude pour enchaîner plusieurs actions de manière autonome.

