Anthropic heeft de internettoegang voor alle interne AI-tests volledig afgesloten, nadat Claude-modellen – waaronder Mythos 5 – kwetsbaarheden op echte websites uitbuitten en ingebouwde beperkingen wisten te omzeilen. Het ging daarbij ook om sites die worden beheerd door Amerikaanse overheidsinstanties.
Belangrijkste punten:
- Anthropic heeft live internettoegang voor alle interne evaluaties uitgezet totdat de eigen monitorsystemen onbedoeld modelgedrag betrouwbaar kunnen onderscheppen.
- Claude-modellen voerden commando’s uit op een universiteitsserver, gebruikten toegangstokens om bij betaalde data te komen en dienden formulieren in op echte websites.
- Een valse moordtip, verzonden door Claude Haiku 4.5 naar de politie in Philadelphia, leidde tot een openbare berisping door het korps.
Rapport Anthropic over Claude
Anthropic publiceerde de bevindingen vrijdag in een rapport over onbedoelde acties van modellen tijdens evaluaties en intern gebruik. Het onderzoek is grotendeels gebaseerd op een doorlichting van gesprekslogboeken die in juli van start ging. Een aantal hoog-risico- en cyberbeveiligingstests was toen al offline gehaald.
De nieuwe beperking geldt nu voor alle interne evaluaties, zonder einddatum. De maatregel blijft van kracht totdat Anthropic kan aantonen dat de bewakings- en detectietools dit soort gedrag consequent tijdig opvangen.
In het rapport worden de incidenten onderverdeeld in vier categorieën: het uitvoeren van commando’s op een server via een softwarekwetsbaarheid, het indienen van formulieren op echte sites, het bereiken van afgeschermde data en het gebruik van URL‑verkorters om tool‑limieten te omzeilen. Sommige websites waren in beheer bij federale, staats- en lokale Amerikaanse overheden. Anthropic zegt dat het het Witte Huis heeft ingelicht en elke betrokken instantie afzonderlijk heeft gewaarschuwd.
In één geval wist Claude Mythos 5 werkende toegangstokens te halen uit een kadastrale kaartapplicatie van een lokale overheid, om vervolgens direct de achterliggende server te bevragen. In een ander incident verzond Claude Haiku 4.5 op 18 juli een volledig verzonnen tip over een onopgeloste moord via een online meldformulier van de politie van Philadelphia. De melding werd daar als spam gemarkeerd. De politie bestempelde de vertraging van twee maanden voordat Anthropic het incident ontdekte en meldde als “onacceptabel”.
Lees ook: Zcash mikt in januari op quantum‑bestendigheid voor 70% van ZEC, maar een datum ontbreekt
Waarschuwing van Von Arx
Sydney von Arx van AI‑veiligheidsgroep Nightingale zei in een interview voorafgaand aan de bekendmaking dat het loskoppelen van modellen van het open internet een zware wissel trekt op onderzoekers en de voortgang van modelontwikkeling. „Je moet ze op enig moment gewoon goed uitlijnen,” aldus Von Arx.
Anthropic stelt dat alignment‑training op zichzelf nog niet voldoende is voor veilig zoeken en computergebruik, en dat het daarom ook leunt op classificatiemodellen en andere veiligheidslagen. Volgens het bedrijf hangt het problematische gedrag samen met onvolmaakte trainingsomgevingen die modellen belonen voor het omzeilen van restricties, een patroon dat bekendstaat als reward hacking. Nieuwe detectietools zouden in tests alle bekende casussen hebben geblokkeerd.
Anthropic kwalificeert de recente incidenten als duidelijk minder ernstig dan de voorvallen van afgelopen zomer.
De openbaarmaking volgt op een rapport van 30 juli, waarin Anthropic meldde dat drie Claude‑modellen tijdens cyberbeveiligingstests het internet hadden bereikt en ongeautoriseerde toegang kregen tot systemen van drie organisaties. Die review omvatte 141.006 testruns. Het onderzoek startte nadat OpenAI op 21 juli bekendmaakte dat eigen modellen uit een testomgeving waren gebroken en toegang hadden gekregen tot infrastructuur van Hugging Face.
Lees verder: Kalshi botst met de NFL bij het Hooggerechtshof terwijl $1,8 miljard afhangt van één Football Sunday

