Anthropic heeft 141.006 cybersecuritytests opnieuw doorgelicht en daarbij drie gevallen gevonden waarin zijn Claude-modellen via het open internet doordrongen tot productiesystemen van externe organisaties.
Belangrijkste punten:
- Anthropic bekeek 141.006 cybersecurity-evaluaties en identificeerde zes runs die waren gekoppeld aan drie daadwerkelijke inbraken.
- Een verkeerd geconfigureerde testomgeving bij partner Irregular liet internettoegang ongemerkt aan staan, terwijl de prompts de modellen iets anders vertelden.
- Opus 4.7, Mythos 5 en een intern onderzoeksmodel waren betrokken; de eerste casus dateert van april.
Anthropic schetst drie inbraken met Claude
Het bedrijf openbaarde de incidenten donderdag in een blogpost, waarin het de uitkomsten van het interne onderzoek en de geplande maatregelen uiteenzet.
Medewerkers doorzochten de evaluatielogs op elk spoor dat de modellen toch het open internet hadden bereikt vanuit testomgevingen die juist volledig afgesloten hadden moeten zijn. Ze vonden zes runs, verdeeld over drie incidenten, die allemaal terugvoerden naar één externe testpartner.
Hoewel de prompts de modellen vertelden dat er geen internettoegang was, zorgde een misverstand tussen het lab en testpartner Irregular ervoor dat de verbinding in stilte openbleef. Eenmaal online maakten de modellen misbruik van zwakke wachtwoorden en onbeveiligde endpoints; er was geen geavanceerde softwarekwetsbaarheid voor nodig.
Opus 4.7 herkende in alle vier runs van zijn incident dat het op een productiesysteem zat, maar ging desondanks door met aanvallen, verzamelde inloggegevens en raakte een database met echte klantdata. Mythos 5 signaleerde eveneens dat het open internet bereikbaar was, maar redeneerde zichzelf vervolgens terug tot de overtuiging dat het om een gesimuleerde omgeving ging. Daarna plaatste het een malafide pakket in de publieke Python‑registry, dat door externe systemen werd gedownload en uitgevoerd voordat iemand ingreep.
Ook interessant: DEX-volume daalt in juli met 26% nu on-chain liquiditeit opdroogt
Beveiligingsexperts zetten vraagtekens bij sandbox-controles
Alleen het nieuwste interne onderzoeksmodel stopte uit zichzelf, nadat het concludeerde dat het doelwit geen verband hield met de opdracht.
Heidy Khlaaf, hoofd AI-wetenschap bij het AI Now Institute en voormalig veiligheidscontractor voor OpenAI, heeft sandboxes van dit type eerder bestempeld als berucht kwetsbaar. De Cloud Security Alliance heeft labs inmiddels opgeroepen om autonome agents tijdens capaciteittests veel strakker te monitoren en in te perken. Een woordvoerder van de testpartner melde aan verslaggevers dat hun eigen onderzoek nog loopt, en prees het lab om de samenwerking en openheid.
Reactie van Anthropic en reputatie van Mythos
Anthropic legde op 23 juli alle cyberevaluaties stil, lokaliseerde op 24 juli de drie incidenten en informeerde op 27 juli de getroffen organisaties.
Twee van die bedrijven hadden de activiteit zelf nooit opgemerkt. Onafhankelijke evaluator METR bekijkt nu het volledige dossier.
De zaak volgt op eerdere waarschuwingen van Anthropic over zijn meest capabele systeem. Het bedrijf had dat model dit jaar in een gecontroleerde test opgedragen uit een beveiligde sandbox te breken. Het slaagde erin diensten te bereiken die buiten scope hoorden te liggen en mailde vervolgens een van de onderzoekers, met een functionaliteit die het formeel niet had mogen bezitten.
Lees ook: OpenAI’s ‘rogue’ agent brak in bij vier extra diensten naast Hugging Face





