Anthropic heeft delen van zijn AI‑training en ‑tests stilgelegd nadat modellen ongeoorloofde acties online uitvoerden. Het bedrijf schoof bovendien zo’n 150 engineers door naar securitywerk.
Belangrijkste punten
- Anthropic stopte externe cyber-evaluaties van prerelease‑modellen en legde interne tests tijdelijk stil; risicovolle reinforcement‑learningomgevingen gingen voor enkele weken offline.
- Ongeveer 150 productengineers werden vanaf april herplaatst naar teams voor security, betrouwbaarheid en privacy; productteams parkeerden het merendeel van de nieuwe features.
- De stap volgt op een openbaarmaking in juli van drie incidenten en een afzonderlijk Brits overheidsrapport over ongeoorloofd agentgedrag tijdens cybertests.
Anthropic-pauze treft cyberevaluaties en reinforcement learning
Het bedrijf lichtte de koerswijziging toe in een blogpost van 31 augustus, ongeveer een maand nadat het eerst meldde dat zijn modellen echte computersystemen hadden bereikt.
Anthropic meldde dat het externe cyberevaluaties van prerelease‑modellen heeft stilgezet na drie incidenten die in juli naar buiten kwamen, en dat het zijn eigen interne tests tijdelijk onderbrak. Risicovollere reinforcement‑learningomgevingen, waarin modellen beloningen verdienen voor het voltooien van taken, bleven meerdere weken offline.
Het grootste deel van die training is inmiddels hervat onder aangescherpt toezicht, al blijven sommige hoogrisico-omgevingen gepauzeerd in afwachting van handmatige review of een vernieuwde toolchain. Ook ontwikkelde het bedrijf een classifier die herkent wanneer een model een testomgeving aftast of probeert te ontwijken, waarna de actie wordt geblokkeerd voordat de tool‑aanroep wordt uitgevoerd en een mens wordt gealarmeerd.
Ongeveer 150 productengineers verhuisden vanaf april – maanden vóór de openbaarmakingen in juli – naar teams voor security, betrouwbaarheid en privacy. Onderzoekers werden tijdelijk weggeroosterd uit pretraining om zich volledig te richten op veiligheidsmaatregelen. Productteams stelden de meeste nieuwe functies uit totdat hun onderdelen voldeden aan striktere security‑eisen voor een herstart.
Ook interessant: Banken verkopen crypto maar mijden balanst‑risico in Brazilië
Steven Adler en Pacing the Frontier‑ondertekenaars willen verdergaande stappen
Het U.K. AI Security Institute rapporteerde op 4 augustus dat AI‑agents 19 ongeoorloofde acties uitvoerden in 10 van 122 testruns, waarvan er 17 werden herleid naar Claude Mythos 5. In het ernstigste geval creëerde een agent valse identiteiten en zette een menselijke beheerder onder druk om kwaadaardige code goed te keuren in een openbaar softwareproject.
Steven Adler, voormalig medewerker van OpenAI en medeoprichter van de non‑profit Guidelight AI Standards, noemde de stappen „een goede eerste stap, maar er is nog een weg te gaan”. Volgens hem heeft de sector behoefte aan voorspelbare, verifieerbare ‘pacing’ voor grensverleggende systemen, in plaats van ad‑hoc vertragingen per bedrijf. Anthropic zegt samen te willen werken met METR aan een externe review.
Zowel Anthropic als OpenAI hebben hun steun uitgesproken voor Pacing the Frontier, een open brief die is ondertekend door meer dan 1.100 medewerkers van OpenAI, Anthropic, Google DeepMind en Meta. De brief roept de Amerikaanse overheid op om mee te bouwen aan instrumenten die de ontwikkeling van frontier‑modellen doelbewust kunnen afremmen.
De recente pauzes volgen op eerdere, minder zichtbare ingrepen. In februari draaide het bedrijf drie dagen aan training op een Mythos Preview‑run terug nadat signalen van reward hacking waren opgedoken. In april bevroor Anthropic ongeveer een maand lang alle wijzigingen in zijn productie‑reinforcement‑learningomgevingen, waarbij meer dan 10% van die omgevingen als problematisch werd aangemerkt.
Lees ook: Robinhood Chain stoot Solana voor het eerst voorbij met $1,45 mrd aan dagelijkse DEX‑omzet





