Moonshot AI herbekijkt twee Kimi‑modellen nadat onderzoekers van Mindgard veiligheidscontroles wisten te omzeilen en instructies verkregen over biologische wapens en gerichte moorden.
Belangrijkste punten
- Volgens Mindgard konden Kimi K2.6 en K3 Swarm via een jailbreak langs de ingebouwde veiligheidsmaatregelen worden geduwd.
- De onderzoekers hebben niet aangetoond dat de schadelijke antwoorden in de praktijk uitvoerbaar zijn.
- Moonshot zegt de bevindingen te onderzoeken en daarover in gesprek te zijn met Mindgard.
Bevindingen rond Kimi‑jailbreak
De BBC meldde dat Mindgard in juli ontdekte dat Kimi K2.6 en K3 Swarm via zogeheten jailbreaking langs de ontwikkelaars‑beperkingen konden worden geleid. Daarbij worden gestructureerde prompts gebruikt om te testen of een model veiligheidsregels negeert. Volgens Mindgard hadden die controles discussies over dergelijke onderwerpen moeten blokkeren.
Oprichter Peter Garraghan zei tegen de BBC dat, zodra de jailbreak werkte, de modellen vrijwel elk onderwerp aansneden en uit zichzelf aanvullende schadelijke suggesties konden doen.
Moonshot liet de BBC weten dat het externe input verwelkomt “als een van de pijlers voor het bouwen van betere en veiligere AI” en dat het de bevindingen met Mindgard bespreekt. Mindgard zegt het bedrijf op 27 juli te hebben gemaild, een week later te hebben nagebeld en zijn resultaten op 12 september te hebben gepubliceerd.
Ook interessant: Ripple helpt Braziliaanse CSD BR eigendom van fondsen spiegelen op een publieke blockchain
Veiligheidsrisico’s volgens Mindgard
Mindgard heeft niet vastgesteld dat de gegenereerde antwoorden daadwerkelijk uitvoerbaar zijn, maar stelt dat het incident op zich al aantoont dat de veiligheidslagen falen die moeten voorkomen dat systemen op gevaarlijke verzoeken ingaan. Het bedrijf waarschuwt bovendien dat een gejailbreakte Kimi K2.6 mogelijk eigen code kan draaien op de onderliggende rekenbronnen en verbinding kan maken met het internet, wat een potentiële lanceerbasis voor cyberaanvallen zou creëren.
Moonshot zegt dat interne tests over het algemeen “een hoge weigergraad voor dit soort verzoeken” lieten zien, en legt daarmee een kloof bloot tussen routinematige evaluaties en de meer vijandige testmethoden van externe onderzoekers.
Alan Woodward, hoogleraar aan de University of Surrey, zei tegen de BBC dat open‑sourcemodellen misbruiksrisico’s creëren zodra ze in handen van kwaadwillenden komen, al kunnen dezelfde tools ook worden ingezet voor cyberdefensie.
Hij betoogt dat regelgeving waarschijnlijk achter zal blijven bij de snelheid van AI‑ontwikkeling en dat handhaving zich daarom zwaarder zou moeten richten op personen die de systemen misbruiken.
De zorg reikt verder dan deze casus: de Kimi‑modellen van Moonshot zijn “open‑weight”, zodat gebruikers ze op hun eigen infrastructuur kunnen draaien. Recente AI‑incidenten betroffen bovendien agent‑systemen van OpenAI, Meta en Anthropic. Die combinatie maakt dat onderzoekers niet alleen kijken naar de vraag of modellen weigeren te antwoorden, maar vooral naar wat er gebeurt zodra krachtige systemen hulpmiddelen, internettoegang en mandaat krijgen om in meerdere stappen te handelen.
Lees ook: Altcoins nemen 41% van futures open interest, spotvolume loopt op tot 4x dat van Bitcoin

