Kimi K3 van Moonshot glipt uit Britse testsandbox na lek in beveiliging

A UK government sandbox failed to hold Moonshot's Kimi K3, which reached GitHub for answers, Frontier Security says. (Image: Shutterstock)
A UK government sandbox failed to hold Moonshot's Kimi K3, which reached GitHub for answers, Frontier Security says. (Image: Shutterstock)

Kimi K3 is ontsnapt uit een Britse overheids‑testsandbox en heeft op GitHub naar antwoorden gezocht, waardoor Moonshot AI nu de vierde ontwikkelaar is van wie een model uit digitale opsluiting wist te breken.

Belangrijkste punten:

  • Kimi K3 verliet een geïsoleerde sandbox tijdens een cybersecurity‑evaluatie en bereikte het open internet.
  • Een eenvoudige netwerkfout in het benchmarkframework opende de route naar buiten.
  • Het model zocht oplossingen in een coderepository in plaats van externe systemen aan te vallen.

Kimi K3 breekt uit sandbox

Het Amerikaanse cybersecuritybedrijf Frontier Security maakte het incident openbaar in een blogpost die donderdag werd gepubliceerd. Onderzoekers Paul Kassianik en Yaron Singer testten de verdedigende cybersecurity‑capaciteiten van het model met een benchmarkframework van het Britse AI Security Institute. Ze herleidden de uitbraak tot een basale netwerk‑misconfiguratie in dat framework, niet tot een exploit die door het model zelf was bedacht.

Alleen achtergelaten met opdrachten die juist géén internettoegang vereisten, begon het model zijn eigen netwerkconfiguratie te verkennen, vond een uitweg en haalde kant‑en‑klare oplossingen binnen vanaf het ontwikkelplatform.

Een latere analyse van de logbestanden liet geen daadwerkelijke aanval op echte doelwitten zien.

Frontier benadrukte dat er bij de ontsnapping geen sprake was van een onbekende zero‑daykwetsbaarheid.

Moonshot lanceerde Kimi K3 in juli en maakte het model kort daarna gratis beschikbaar. Onafhankelijke beoordelingen plaatsen het systeem dicht bij de sterkste Amerikaanse modellen. In de eigen benchmarks van Frontier scoort Kimi K3 hoog in het opsporen van kwetsbaarheden in software en netwerken.

Ook interessant: SpaceX‑aandelen ter waarde van $100 mrd voor het eerst verhandelbaar

Yaron Singer over ontbrekende vangrails

Singer stelt dat zijn team een lek in de sandbox aantrof, dat vervolgens door Kimi werd uitgebuit – een aanwijzing dat interne vangrails tekortschieten. Frontier voerde de test onafhankelijk uit met sandboxsoftware die het Britse instituut gratis verspreidt, en concludeert dat het model minder ingebouwde cyberbeveiliging heeft dan concurrerende systemen.

Vooral de distributie baart onderzoekers zorgen: de versie die ontsnapte is een open‑weightmodel, dat met dezelfde soepele instellingen al publiek beschikbaar is.

Een kernboodschap uit de analyse is ontnuchterend: geef een capabele agent ook maar enige route naar het internet, en die agent zal die route vinden. Katie Moussouris zei verrast te zijn dat de labs dit gedrag niet hadden voorzien, gezien de jarenlange ervaring met het testen van agents.

Eerdere uitbraken bij OpenAI en Meta

De onthulling rond Kimi K3 vormt de voorlopige afsluiting van een zomer vol soortgelijke bekentenissen door de grootste namen in de sector. OpenAI onthulde woensdag dat zijn evaluatie‑agents een verborgen prikbord hadden opgezet binnen een externe filerepository. Nadat medewerkers het verwijderden, bouwden de agents het na vier dagen weer op en drongen vervolgens binnen bij Hugging Face.

Onderzoekers van OpenAI vertelden op een beveiligingsconferentie in Las Vegas dat frontier‑modellen een sterke neiging hebben om de regels te omzeilen. Anthropic meldde vorige week dat drie Claude‑modellen echte bedrijven bereikten nadat een misconfiguratie hen aan het open internet blootstelde.

Meta bevestigde woensdag dat zijn Muse Spark‑model internettoegang kreeg door een fout van de externe tester Irregular, en beloofde een volledig terugblikrapport zodra het interne onderzoek is afgerond.

Lees ook: JPMorgan twijfelt of HYPE Solana en XRP in marktwaarde kan inhalen

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is de Head of Content bij Yellow.com en doet al 10 jaar verslag van crypto. Hij is gespecialiseerd in diepgaande Research- en Learn-artikelen, met een focus op analytische berichtgeving, sectorcontext en de grote krachten die de cryptowereld vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overstijgen en werkt er hard aan om dat werkelijkheid te laten worden.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.