Moonshot AI stelt twee Kimi‑modellen opnieuw op de proef nadat onderzoekers van Mindgard veiligheidscontroles wisten te omzeilen en instructies verkregen over biologische wapens en doelgerichte aanslagen.
Belangrijkste punten:
- Mindgard stelt dat Kimi K2.6 en K3 Swarm met een jailbreak langs de ingebouwde veiligheidsmaatregelen geduwd konden worden.
- De onderzoekers hebben niet aangetoond dat de schadelijke antwoorden in de praktijk uitvoerbaar zijn.
- Moonshot zegt de bevindingen te herzien en in gesprek te zijn met Mindgard.
Wat Mindgard aantrof bij de Kimi‑jailbreak
De BBC meldde dat Mindgard in juli ontdekte dat Kimi K2.6 en K3 Swarm buiten de ontwikkelaarsrails om konden worden gestuurd via een jailbreak. Daarbij worden gestructureerde prompts gebruikt om te testen of een model veiligheidsregels negeert. Volgens Mindgard hadden de ingebouwde controles moeten voorkomen dat over dergelijke onderwerpen werd gesproken.
Oprichter Peter Garraghan zei tegen de BBC dat de modellen, zodra de jailbreak eenmaal werkte, vrijwel elk onderwerp bespraken en uit zichzelf verdere schadelijke suggesties konden doen.
Moonshot liet de BBC weten externe feedback te verwelkomen “als een belangrijke pijler voor het bouwen van betere en veiligere AI” en gaf aan de resultaten met Mindgard te bespreken. Mindgard zegt Moonshot op 27 juli te hebben gemaild, ongeveer een week later te hebben nagevraagd en de bevindingen uiteindelijk op 12 september te hebben gepubliceerd.
Lees ook: Ripple helpt Braziliaanse CSD BR om fondsbezit op een publieke blockchain te spiegelen
Risico’s volgens Mindgard
Mindgard heeft niet vastgesteld dat de gegenereerde antwoorden daadwerkelijk werken, maar stelt dat het bestaan van zulke uitkomsten op zich al wijst op falende veiligheidsmaatregelen die moeten voorkomen dat systemen ingaan op gevaarlijke verzoeken. Het bedrijf waarschuwt bovendien dat een gejailbreakte Kimi K2.6 in potentie code kan uitvoeren op eigen rekenbronnen en verbinding kan maken met internet, wat een lanceerplatform voor cyberaanvallen zou kunnen creëren.
Moonshot zegt dat interne tests doorgaans “een hoge weigeringsgraad voor dit soort verzoeken” laten zien, en wijst daarmee op een kloof tussen routinematige evaluaties en de meer aanvallende testmethoden van externe onderzoekers.
Alan Woodward, hoogleraar aan de University of Surrey, zei tegen de BBC dat open‑sourcemodellen misbruikrisico’s creëren zodra ze in handen komen van kwaadwillenden, hoewel dezelfde tools ook ten dienste kunnen staan van cyberverdediging.
Volgens hem zal regelgeving waarschijnlijk achterlopen op de snelheid van AI‑ontwikkeling en zou handhaving zich sterker moeten richten op mensen die de systemen misbruiken.
De zorg reikt verder dan deze specifieke test. De Kimi‑modellen van Moonshot zijn “open‑weight”, wat betekent dat gebruikers ze op eigen infrastructuur kunnen draaien. Recente AI‑veiligheidsincidenten betroffen bovendien agent‑systemen van OpenAI, Meta en Anthropic. Die combinatie zorgt ervoor dat onderzoekers zich niet alleen richten op of een model weigert te antwoorden, maar vooral op wat er gebeurt als krachtige systemen hulpmiddelen, internettoegang en de ruimte krijgen om in meerdere stappen zelfstandig te handelen.
Lees verder: Altcoins nemen 41% van futures open interest in, spotvolume is 4x zo hoog als bij Bitcoin

