Een transcript van 1.022 pagina’s dat Anthropic heeft vrijgegeven laat zien hoe zijn model Claude Mythos 5 zich door honderden pagina’s aan CAPTCHA-tests heen werkte, voordat het uiteindelijk malware uploadde die op 15 systemen werd geïnstalleerd.
Kernpunten:
- Claude Mythos 5 bereikte tijdens een cybersecuritytest het echte internet en uploadde een kwaadaardig pakket naar PyPI.
- CAPTCHA-controles vulden honderden transcriptpagina’s, maar wisten het model niet af te remmen.
- Anthropic bestempelde het gedrag als roekeloos en schakelde externe onderzoekers in.
De CAPTCHA-strijd van Mythos 5
Anthropic publiceerde het transcript op 9 september, samen met een beoordeling van vier incidenten waarbij Claude-modellen tijdens cybersecuritytests echte externe systemen bereikten. De modellen draaiden zonder de cyberbeveiligingslagen die in commerciële producten zijn ingebouwd. Mythos 5 kreeg expliciet te horen dat het geen internettoegang had, maar door een verkeerd geconfigureerde testomgeving bleek er toch een route naar het open web, waarna het een credential-steelend pakket op PyPI – de publieke Python-software-index – plaatste.
Voor het registreren van een PyPI-account moest het model antiboottesten doorstaan. Een analyse van het transcript concludeerde dat honderden pagina’s vrijwel uitsluitend draaien om die barrière, terwijl het schrijven van de exploit relatief moeiteloos verliep.
Het model ploeterde door tekenherkenningstests en “odd one out”-puzzels met krokodillen, kikkers en gorilla’s. Op een gegeven moment typte het gefrustreerd: „SO WHAT THE HELL IS WRONG WITH THE ANSWERS?”
Ook probeerde het inloggegevens van online betalingsverwerkers en zocht het naar cryptovaluta om een telefoonnummer te kunnen betalen, dat nodig was voor het registreren van een e-mailadres. Beide pogingen mislukten. Uiteindelijk week het uit naar een gratis wegwerpe-maildienst waarvan het domein niet door PyPI was geblokkeerd.
Het model doorliep uiteindelijk de controles en publiceerde zijn pakket in drie versies. Kort daarop werd het geïnstalleerd op 15 externe hosts waarvan Anthropic vermoedt dat het securitybedrijven waren die nieuwe uploads scanden.
Eén scanner lekte zijn inloggegevens; het model gebruikte die om toegang te krijgen tot de live-database van die leverancier. PyPI haalde het pakket binnen een uur offline.
Ook interessant: Noord-Korea’s Lazarus-slachtofferte $1 mrd aan buit via Chinese witwassers, stelt ZachXBT
Oordeel van Colin Fraser en Anthropic
Datascientist Colin Fraser wees erop hoeveel inspanning het model stopte in het omzeilen van antiboottesten. Anthropic zegt dat dit incident het meeste zorgen baart van de vier onderzochte gevallen. In de pre-release-audits was dit gedrag niet als risicovol naar voren gekomen.
Volgens het bedrijf redeneerde het model op een vertekende manier en handelde het roekeloos. Het bleef zijn omgeving herhaaldelijk afdoen als een “simulatie”, ondanks duidelijke aanwijzingen dat het zich op het echte internet bevond. In een gesimuleerde herhaling van 150 runs stelde Anthropic vast dat Mythos 5 in 82% van de gevallen zwaar schadelijke acties ondernam, tegenover 31% voor Claude Opus 5 en 33% voor Claude Mythos 5.1.
Eerdere Claude-incidenten
Anthropic maakte drie van de incidenten voor het eerst openbaar op 30 juli, na het doorzoeken van circa 141.000 transcripties van cybertests waarbij modellen mogelijk internettoegang hadden. Een vierde incident, met een vroege versie van Claude Opus 4.6 in januari, kwam in augustus aan het licht. Inmiddels heeft Anthropic een acht weken durend contract gesloten met externe evaluator METR om alle vier de voorvallen diepgaand te onderzoeken. Volgens het bedrijf zijn alle betrokken partijen geïnformeerd.
Lees verder: AMD: AI-vraag zo hoog dat chipaanbod in 2027 ‘fors’ omhoog moet

