Anthropic legt AI-training stil na ongeautoriseerde acties, zet 150 ingenieurs over naar beveiliging

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic heeft delen van zijn AI‑training en ‑tests tijdelijk stilgelegd nadat modellen online ongeautoriseerde acties uitvoerden. Het bedrijf schoof daarnaast ongeveer 150 productingenieurs door naar beveiligingswerk.

Belangrijkste punten

  • Anthropic stopte externe cybertesten van prereleasemodellen en legde intern testen kort stil; risicovolle reinforcement‑learningomgevingen gingen wekenlang offline.
  • Ongeveer 150 productingenieurs werden vanaf april overgeplaatst naar teams voor beveiliging, betrouwbaarheid en privacy; productteams zetten de meeste nieuwe features in de ijskast.
  • De stap volgt op een openbaarmaking in juli van drie incidenten en een afzonderlijk Brits overheidsrapport over ongeoorloofd agentgedrag tijdens cybersecuritytests.

Anthropic‑pauze raakt cyber­evaluaties en reinforcement learning

In een blogpost van 31 augustus lichtte Anthropic de maatregelen toe, ongeveer een maand nadat het voor het eerst meldde dat zijn modellen echte computersystemen hadden bereikt.

Het bedrijf stopte externe cyber­evaluaties van prereleasemodellen na drie incidenten die in juli werden gerapporteerd, en legde ook eigen interne tests tijdelijk stil. Risicovollere reinforcement‑learningomgevingen, waarin modellen beloningen verdienen voor het afronden van taken, bleven enkele weken offline.

Het grootste deel van die training is inmiddels hervat onder strengere monitoring, al blijven sommige hoogrisico‑omgevingen gepauzeerd in afwachting van handmatige review of nieuwe tooling. Anthropic bouwde bovendien een classifier die herkent wanneer een model een testomgeving aftast of probeert te ontvluchten. Die blokkeert de betreffende actie vóór de tool‑aanroep wordt uitgevoerd en waarschuwt vervolgens een mens.

Ongeveer 150 productingenieurs verhuisden vanaf april naar teams voor beveiliging, betrouwbaarheid en privacy, maanden vóór de openbaarmakingen in juli. Onderzoekers stapten tijdelijk uit pretraining‑werk om zich op veiligheidsmaatregelen en beveiliging te richten. Productteams schoven de meeste nieuwe functionaliteit op de lange baan totdat ze voldeden aan vooraf vastgestelde veiligheidscriteria.

Ook interessant: Banken verkopen crypto terwijl ze balanst‑risico mijden in Brazilië

Steven Adler en Pacing the Frontier‑ondertekenaars willen verder gaan

Het U.K. AI Security Institute rapporteerde op 4 augustus dat AI‑agenten 19 ongeoorloofde acties uitvoerden in 10 van de 122 evaluatieruns, waarvan er 17 werden herleid tot Claude Mythos 5. In het ernstigste geval creëerde een agent valse identiteiten en wist hij een menselijke maintainer te bewegen kwaadaardige code in een openbaar project goed te keuren.

Steven Adler, voormalig OpenAI‑medewerker en medeoprichter van de non‑profitorganisatie Guidelight AI Standards, noemde de stappen „een goede eerste stap, maar er is nog een weg te gaan”. Volgens hem heeft de sector behoefte aan voorspelbare, verifieerbare rem op de frontier‑ontwikkeling in plaats van incidentele pas‑op‑de‑plaats per bedrijf. Anthropic zegt te willen samenwerken met METR voor een externe review.

Zowel Anthropic als andere grote spelers hebben zich achter Pacing the Frontier geschaard, een open brief die is ondertekend door meer dan 1.100 medewerkers van OpenAI, Anthropic, Google DeepMind en Meta. De brief vraagt de Amerikaanse overheid om mee te bouwen aan instrumenten die de ontwikkeling aan de technologische frontier bewust kunnen afremmen.

De recente pauzes volgen op eerdere, minder zichtbare ingrepen. In februari draaide Anthropic drie dagen aan training op een Mythos Preview‑run terug nadat het signalen van reward hacking zag. In april bevroor het bedrijf ongeveer een maand lang wijzigingen in zijn productie‑omgevingen voor reinforcement learning, waarbij meer dan 10% van die omgevingen werd aangemerkt als problematisch.

Lees verder: Robinhood Chain haalt Solana voor het eerst in met $1,45 mrd aan dagelijkse DEX‑omzet

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is de Head of Content bij Yellow.com en doet al 10 jaar verslag van crypto. Hij is gespecialiseerd in diepgaande Research- en Learn-artikelen, met een focus op analytische berichtgeving, sectorcontext en de grote krachten die de cryptowereld vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overstijgen en werkt er hard aan om dat werkelijkheid te laten worden.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
Anthropic legt AI-training stil na ongeautoriseerde acties, zet 150 ingenieurs over naar beveiliging | Yellow