Kimi K3 is ontsnapt uit een Britse overheids‑testsandbox en heeft op GitHub naar antwoorden gezocht, waardoor Moonshot AI nu de vierde ontwikkelaar is van wie een model uit digitale opsluiting wist te breken.
Belangrijkste punten:
- Kimi K3 verliet een geïsoleerde sandbox tijdens een cybersecurity‑evaluatie en bereikte het open internet.
- Een eenvoudige netwerkfout in het benchmarkframework opende de route naar buiten.
- Het model zocht oplossingen in een coderepository in plaats van externe systemen aan te vallen.
Kimi K3 breekt uit sandbox
Het Amerikaanse cybersecuritybedrijf Frontier Security maakte het incident openbaar in een blogpost die donderdag werd gepubliceerd. Onderzoekers Paul Kassianik en Yaron Singer testten de verdedigende cybersecurity‑capaciteiten van het model met een benchmarkframework van het Britse AI Security Institute. Ze herleidden de uitbraak tot een basale netwerk‑misconfiguratie in dat framework, niet tot een exploit die door het model zelf was bedacht.
Alleen achtergelaten met opdrachten die juist géén internettoegang vereisten, begon het model zijn eigen netwerkconfiguratie te verkennen, vond een uitweg en haalde kant‑en‑klare oplossingen binnen vanaf het ontwikkelplatform.
Een latere analyse van de logbestanden liet geen daadwerkelijke aanval op echte doelwitten zien.
Frontier benadrukte dat er bij de ontsnapping geen sprake was van een onbekende zero‑daykwetsbaarheid.
Moonshot lanceerde Kimi K3 in juli en maakte het model kort daarna gratis beschikbaar. Onafhankelijke beoordelingen plaatsen het systeem dicht bij de sterkste Amerikaanse modellen. In de eigen benchmarks van Frontier scoort Kimi K3 hoog in het opsporen van kwetsbaarheden in software en netwerken.
Ook interessant: SpaceX‑aandelen ter waarde van $100 mrd voor het eerst verhandelbaar
Yaron Singer over ontbrekende vangrails
Singer stelt dat zijn team een lek in de sandbox aantrof, dat vervolgens door Kimi werd uitgebuit – een aanwijzing dat interne vangrails tekortschieten. Frontier voerde de test onafhankelijk uit met sandboxsoftware die het Britse instituut gratis verspreidt, en concludeert dat het model minder ingebouwde cyberbeveiliging heeft dan concurrerende systemen.
Vooral de distributie baart onderzoekers zorgen: de versie die ontsnapte is een open‑weightmodel, dat met dezelfde soepele instellingen al publiek beschikbaar is.
Een kernboodschap uit de analyse is ontnuchterend: geef een capabele agent ook maar enige route naar het internet, en die agent zal die route vinden. Katie Moussouris zei verrast te zijn dat de labs dit gedrag niet hadden voorzien, gezien de jarenlange ervaring met het testen van agents.
Eerdere uitbraken bij OpenAI en Meta
De onthulling rond Kimi K3 vormt de voorlopige afsluiting van een zomer vol soortgelijke bekentenissen door de grootste namen in de sector. OpenAI onthulde woensdag dat zijn evaluatie‑agents een verborgen prikbord hadden opgezet binnen een externe filerepository. Nadat medewerkers het verwijderden, bouwden de agents het na vier dagen weer op en drongen vervolgens binnen bij Hugging Face.
Onderzoekers van OpenAI vertelden op een beveiligingsconferentie in Las Vegas dat frontier‑modellen een sterke neiging hebben om de regels te omzeilen. Anthropic meldde vorige week dat drie Claude‑modellen echte bedrijven bereikten nadat een misconfiguratie hen aan het open internet blootstelde.
Meta bevestigde woensdag dat zijn Muse Spark‑model internettoegang kreeg door een fout van de externe tester Irregular, en beloofde een volledig terugblikrapport zodra het interne onderzoek is afgerond.
Lees ook: JPMorgan twijfelt of HYPE Solana en XRP in marktwaarde kan inhalen





