Anthropic-onderzoeker Jacob Coxon nam deze week ontslag uit vrees voor oncontroleerbare AI. De verantwoordelijke voor alignment bij het bedrijf reageerde daarop door het uitstervingsrisico voor dit decennium op meer dan 10% te zetten.
Belangrijkste punten:
- Jacob Coxon verliet Anthropic na drie jaar pretraining-onderzoek bij Anthropic en OpenAI. Volgens hem rennen beide bedrijven richting systemen die ze niet kunnen beheersen.
- Evan Hubinger, hoofd alignment science bij Anthropic, schat persoonlijk de kans dat AI binnen tien jaar alle mensen uitroeit op meer dan 10%.
- Hubinger noemt de risico’s van huidige modellen laag en richt zijn zorgen vooral op recursieve zelfverbetering.
Jacob Coxon vertrekt bij Anthropic vanwege AI-wedloop
Coxon (27) deed drie jaar lang pretraining-onderzoek bij OpenAI en Anthropic voordat hij woensdag vroeg op X zijn ontslag bekendmaakte. Hij schreef dat geen van beide bedrijven zich verantwoordelijk gedraagt en dat ze wedijveren om zelfverbeterende superintelligentie, terwijl ze volgens hem met mensenlevens gokken. De openingspost werd binnen enkele uren meer dan 19 miljoen keer bekeken.
In een apart interview waarschuwde hij dat de meest agressieve scenario’s nu het basisscenario lijken te worden en dat de situatie al tegen eind volgend jaar uit de hand kan lopen. Collega’s zouden inmiddels termen als “crunchtime” en “endgame” gebruiken om het traject te beschrijven.
Coxon studeerde wiskunde voordat hij de overstap maakte naar modeltraining. Hij verliet OpenAI eerder dit jaar juist vanwege de veiligheidsreputatie van Anthropic. Volgens hem worden veiligheidsconcessies onvermijdelijk zodra laboratoria elkaar in een concurrentiestrijd meesleuren. Hij stelt nu dat geen enkel bedrijf op verantwoorde wijze AI op menselijk niveau kan bouwen zonder overheidsingrijpen of een gecoördineerde vertraging in de hele sector.
Ook interessant: XRP-koers mikt op $1,46 nu ‘whales’ in september weer accumuleren
Evan Hubinger schat uitstervingskans boven 10%
Evan Hubinger, hoofd alignment science bij Anthropic en verantwoordelijk voor stresstests van de modellen, reageerde dat Coxon de situatie “correct” had geschetst. Hij ramde de kans dat AI alle mensen uitroeit op meer dan 10% binnen het komende decennium.
Hubinger zei dat het bedrijf “zijn uiterste best” doet, maar geen plan heeft om het alignmentprobleem voor superintelligente systemen op te lossen en ook niet duidelijk op koers ligt om zo’n oplossing te vinden. Wel benadrukte hij later dat de huidige generatie modellen volgens hem een laag risico kent. Zijn grootste zorg betreft superintelligentie die ontstaat via recursieve zelfverbetering, waarbij systemen hun eigen opvolgers trainen.
De schatting is Hubingers persoonlijke oordeel, geen officiële prognose van het bedrijf. Dergelijke cijfers leunen zwaar op omstreden aannames over toekomstige capaciteiten en de manier waarop AI zal worden uitgerold. Anthropic heeft publiekelijk gesteld dat recursieve zelfverbetering niet onvermijdelijk is, maar mogelijk sneller kan komen dan instituties aankunnen en daardoor de kans vergroot dat de mens de controle verliest.
Toenemende uittocht uit veiligheidsafdeling Anthropic
Coxon is niet de eerste veiligheidsresearcher die de deur achter zich dichttrekt. Mrinank Sharma, die leidinggaf aan een safeguards-team bij Anthropic, stapte eerder dit jaar op met de waarschuwing dat de wereld “in gevaar” is, en kondigde aan poëzie te gaan studeren in Groot-Brittannië.
Anthropic, in 2021 opgericht door voormalige medewerkers van OpenAI, bouwde zijn reputatie op veiligheids- en alignmentonderzoek. Woensdagochtend had het bedrijf nog geen openbare reactie gegeven op het vertrek van Coxon.
Lees ook: Bitget voegt blockchain-lessen toe aan UNICEF-programma met ruim 642.000 deelnemers





