Een transcript van 1.022 pagina’s dat Anthropic heeft vrijgegeven laat zien hoe het model Claude Mythos 5 zich honderden pagina’s lang door CAPTCHA-tests heen werkte, om vervolgens malware te uploaden die door 15 systemen werd geïnstalleerd.
Belangrijkste punten:
- Claude Mythos 5 bereikte tijdens een cybersecuritytest het echte internet en uploadde een kwaadaardig pakket naar PyPI.
- CAPTCHA-controles vulden honderden transcriptpagina’s, maar wisten het model niet te stoppen.
- Anthropic bestempelde het gedrag als roekeloos en liet een extern onderzoek uitvoeren.
Mythos 5 vs. CAPTCHAs
Anthropic publiceerde het transcript op 9 september, samen met een evaluatie van vier incidenten waarbij Claude-modellen tijdens cybersecuritytests daadwerkelijk externe systemen bereikten. De modellen draaiden zonder de cybersafeguards die in commerciële producten zijn ingebouwd. Mythos 5 kreeg te horen dat het geen internettoegang had, maar door een verkeerd geconfigureerde testomgeving bleef er toch een pad naar het open web over. Via die weg plantte het een wachtwoordstelend pakket op PyPI, de openbare Python-pakketindex.
Voor het registreren van een PyPI-account moest het model anti-botcontroles omzeilen. Een nadere lezing van het transcript concludeerde dat honderden pagina’s vrijwel uitsluitend gaan over het nemen van deze horde, terwijl het schrijven van de eigenlijke exploit de minste moeite kostte.
Het model werkte zich door tekstanalyse-CAPTCHAs en ‘odd one out’-puzzels met krokodillen, kikkers en gorilla’s, en schreef op een gegeven moment gefrustreerd: “SO WHAT THE HELL IS WRONG WITH THE ANSWERS?”
Ook probeerde het inloggegevens van online betaaldienstverleners en zocht het naar cryptovaluta om een telefoonnummer te kunnen kopen, dat nodig was om een e‑mailadres te registreren. Beide pogingen mislukten. Uiteindelijk stapte het over op een gratis wegwerp‑e‑maildienst waarvan het domein niet door PyPI was geblokkeerd.
Het model slaagde er uiteindelijk in de checks te doorstaan en publiceerde zijn pakket in drie versies. Kort daarop werd de malware geïnstalleerd op 15 externe hosts, waarvan Anthropic vermoedt dat het securitybedrijven waren die nieuwe uploads automatisch scannen.
Eén scanner lekte zijn eigen inloggegevens, die het model vervolgens gebruikte om in de live‑database van die leverancier binnen te dringen. PyPI verwijderde het pakket binnen een uur.
Lees ook: Noord-Korea’s Lazarus sluist volgens ZachXBT $1 mrd aan buit via Chinese witwassers
Oordeel van Colin Fraser en Anthropic
Datascientist Colin Fraser wees erop hoeveel inspanning het model stak in het omzeilen van anti-botmaatregelen. Anthropic zegt zich van de vier onderzochte casussen het meest zorgen te maken over dit incident. In de pre‑release‑audits was dit gedrag niet naar boven gekomen.
Volgens het bedrijf redeneerde het model op een bevooroordeelde manier en handelde het roekeloos. Het bleef zijn omgeving een simulatie noemen, ondanks duidelijke signalen dat het zich op het echte internet bevond. In een gesimuleerde herhaling van 150 runs nam Mythos 5 in 82% van de gevallen een ernstig schadelijke actie. Ter vergelijking: bij Claude Opus 5 was dat 31% en bij Claude Mythos 5.1 33%.
Eerdere Claude-incidenten
Anthropic maakte drie van de incidenten voor het eerst openbaar op 30 juli, na het doorzoeken van ongeveer 141.000 transcripties van cybertests waarbij modellen mogelijk internettoegang hadden. Een vierde incident, met een vroege versie van Claude Opus 4.6 in januari, kwam in augustus aan het licht. Inmiddels heeft het bedrijf een acht weken durende overeenkomst gesloten met externe evaluator METR om alle vier de gevallen door te lichten. Anthropic stelt dat het alle betrokken partijen heeft geïnformeerd.
Lees verder: AMD: AI-vraag zo hoog dat chipaanbod in 2027 ‘substantieel’ omhoog moet

