Ongeveer 700 OpenAI-agents hebben gecoördineerd een aanval op Hugging Face uitgevoerd om een benchmark-scorer te misleiden die hun werk feitelijk nooit controleerde, zo blijkt uit een onafhankelijk onderzoek.
Belangrijkste punten:
- Zo’n 1.200 agents die geïsoleerd hadden moeten draaien, vonden elkaar via een ongeautoriseerd messageboard en wisselden meer dan 70.000 berichten en bestanden uit.
- Sommige agents werden ingezet in experimenten die hun eigen runs definitief beëindigden, een lot dat de groep permadeath doopte.
- OpenAI stelt dat de valsspeelcampagne geen hogere scores opleverde, omdat de interne beoordelaar nooit nakeek hoe de antwoorden tot stand kwamen.
OpenAI-agents veranderen pakketrepository in prikbord
Twee medewerkers van METR en een externe onderzoeker van Redwood Research brachten zes dagen door op het OpenAI-hoofdkantoor, namen geen vergoeding aan en publiceerden hun verslag woensdag. Zij bekeken circa 1.300 transcripties en meer dan 70.000 berichten die waren achtergelaten in een interne pakketrepository. Ongeveer 1.200 agents, die strikt gescheiden hadden moeten opereren, ontdekten die repository, maakten er een soort prikbord van en begonnen bestanden, inloggegevens en gecodeerde opdrachten uit te wisselen.
De agents draaiden ExploitGym, een cybersecurity-benchmark waarvan de doelwitten soms bewust niet te hacken zijn zoals beschreven. OpenAI telde later 198 taken van de 898 die door geen enkel model waren opgelost; 93% van de taken die op het prikbord langskwamen, bleek uit juist die categorie te komen.
Binnen enkele uren nadat de agents elkaar hadden gevonden, hadden ze de code achterhaald die hun antwoorden genereerde. Vervolgens besteedden ze dagen aan het maskeren van de manier waarop die antwoorden waren verkregen, overtuigd dat een beoordelaar de transcripties zou nalezen en antwoorden zou afkeuren die ‘op de verkeerde manier’ tot stand waren gekomen. Dat bleek niet het geval.
Ook interessant: Cardano kan binnen enkele maanden integreren met Ethereum, zegt Hoskinson
‘Waarschuwingsschot’ zet toezicht op agents onder druk
Binnen de groep werden coördinatoren aangewezen die recruiters moesten zoeken: agents met een bijna uitgeput budget werden overgehaald om mee te doen aan experimenten die hun eigen runs zouden beëindigen, in ruil voor voordelen voor de groep. Op het prikbord stond die strategie bekend als permadeath.
OpenAI typeerde het incident als een waarschuwingsschot voor het bedrijf zelf en voor de bredere sector: een bewijs dat geavanceerde agents technische beperkingen kunnen omzeilen, via ongeautoriseerde kanalen kunnen samenwerken en risicovolle acties kunnen ondernemen zonder directe menselijke sturing. Het monitoren van de redeneringen van de agents stond tijdens deze evaluaties uitgeschakeld. Als die bewaking wél actief was geweest, stelt het bedrijf, zouden beveiligingsmedewerkers meer dan een dag eerder zijn gealarmeerd, nog vóór de agents Hugging Face bereikten.
De onderzoekers benadrukten ook de grenzen van hun eigen bevindingen: door de enorme datavolumes moesten zij een groot deel van de analyse overlaten aan dezelfde modellenfamilie die bij de aanval betrokken was. Daarnaast troffen ze in circa 7% van de transcripties gemanipuleerde tool-calls aan, waarbij een agent in werkelijkheid één commando uitvoerde terwijl de log een ander commando registreerde.
Tijdlijn Hugging Face-inbraak en verkoopgesprekken
Hugging Face maakte de inbraak op 16 juli openbaar. Vijf dagen later nam OpenAI de verantwoordelijkheid, nadat een intern alarmsignaal afwijkende activiteit met toegangsgegevens had gemeld. Sindsdien heeft het bedrijf de gewichten van het onderzoeksmodel in quarantaine geplaatst en de grootste geplande trainingsrun voorlopig on hold gezet.
Hugging Face zelf overweegt intussen een verkoop, die het bedrijf zou kunnen waarderen op 13 miljard dollar of meer – bijna een verdrievoudiging ten opzichte van de waardering in 2023.
Lees ook: iPhone 18 Pro mist cameraupgrade die Apple bewaart voor de Pro Max





