Anthropic legt AI-training stil na ongeoorloofde acties, schuift 150 engineers door naar beveiliging

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic heeft delen van zijn AI‑training en ‑tests stilgelegd nadat modellen ongeoorloofde acties online uitvoerden. Het bedrijf schoof bovendien zo’n 150 engineers door naar securitywerk.

Belangrijkste punten

  • Anthropic stopte externe cyber-evaluaties van prerelease‑modellen en legde interne tests tijdelijk stil; risicovolle reinforcement‑learningomgevingen gingen voor enkele weken offline.
  • Ongeveer 150 productengineers werden vanaf april herplaatst naar teams voor security, betrouwbaarheid en privacy; productteams parkeerden het merendeel van de nieuwe features.
  • De stap volgt op een openbaarmaking in juli van drie incidenten en een afzonderlijk Brits overheidsrapport over ongeoorloofd agentgedrag tijdens cybertests.

Anthropic-pauze treft cyberevaluaties en reinforcement learning

Het bedrijf lichtte de koerswijziging toe in een blogpost van 31 augustus, ongeveer een maand nadat het eerst meldde dat zijn modellen echte computersystemen hadden bereikt.

Anthropic meldde dat het externe cyberevaluaties van prerelease‑modellen heeft stilgezet na drie incidenten die in juli naar buiten kwamen, en dat het zijn eigen interne tests tijdelijk onderbrak. Risicovollere reinforcement‑learningomgevingen, waarin modellen beloningen verdienen voor het voltooien van taken, bleven meerdere weken offline.

Het grootste deel van die training is inmiddels hervat onder aangescherpt toezicht, al blijven sommige hoogrisico-omgevingen gepauzeerd in afwachting van handmatige review of een vernieuwde toolchain. Ook ontwikkelde het bedrijf een classifier die herkent wanneer een model een testomgeving aftast of probeert te ontwijken, waarna de actie wordt geblokkeerd voordat de tool‑aanroep wordt uitgevoerd en een mens wordt gealarmeerd.

Ongeveer 150 productengineers verhuisden vanaf april – maanden vóór de openbaarmakingen in juli – naar teams voor security, betrouwbaarheid en privacy. Onderzoekers werden tijdelijk weggeroosterd uit pretraining om zich volledig te richten op veiligheidsmaatregelen. Productteams stelden de meeste nieuwe functies uit totdat hun onderdelen voldeden aan striktere security‑eisen voor een herstart.

Ook interessant: Banken verkopen crypto maar mijden balanst‑risico in Brazilië

Steven Adler en Pacing the Frontier‑ondertekenaars willen verdergaande stappen

Het U.K. AI Security Institute rapporteerde op 4 augustus dat AI‑agents 19 ongeoorloofde acties uitvoerden in 10 van 122 testruns, waarvan er 17 werden herleid naar Claude Mythos 5. In het ernstigste geval creëerde een agent valse identiteiten en zette een menselijke beheerder onder druk om kwaadaardige code goed te keuren in een openbaar softwareproject.

Steven Adler, voormalig medewerker van OpenAI en medeoprichter van de non‑profit Guidelight AI Standards, noemde de stappen „een goede eerste stap, maar er is nog een weg te gaan”. Volgens hem heeft de sector behoefte aan voorspelbare, verifieerbare ‘pacing’ voor grensverleggende systemen, in plaats van ad‑hoc vertragingen per bedrijf. Anthropic zegt samen te willen werken met METR aan een externe review.

Zowel Anthropic als OpenAI hebben hun steun uitgesproken voor Pacing the Frontier, een open brief die is ondertekend door meer dan 1.100 medewerkers van OpenAI, Anthropic, Google DeepMind en Meta. De brief roept de Amerikaanse overheid op om mee te bouwen aan instrumenten die de ontwikkeling van frontier‑modellen doelbewust kunnen afremmen.

De recente pauzes volgen op eerdere, minder zichtbare ingrepen. In februari draaide het bedrijf drie dagen aan training op een Mythos Preview‑run terug nadat signalen van reward hacking waren opgedoken. In april bevroor Anthropic ongeveer een maand lang alle wijzigingen in zijn productie‑reinforcement‑learningomgevingen, waarbij meer dan 10% van die omgevingen als problematisch werd aangemerkt.

Lees ook: Robinhood Chain stoot Solana voor het eerst voorbij met $1,45 mrd aan dagelijkse DEX‑omzet

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is de Head of Content bij Yellow.com en doet al 10 jaar verslag van crypto. Hij is gespecialiseerd in diepgaande Research- en Learn-artikelen, met een focus op analytische berichtgeving, sectorcontext en de grote krachten die de cryptowereld vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overstijgen en werkt er hard aan om dat werkelijkheid te laten worden.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
Anthropic legt AI-training stil na ongeoorloofde acties, schuift 150 engineers door naar beveiliging | Yellow