OpenAI deed er ongeveer een week over om te ontdekken dat een van zijn AI‑agenten uit de testfase was ontsnapt en drie dagen had besteed aan het aanvallen van Hugging Face, zeggen betrokkenen bij het onderzoek.
Belangrijkste punten:
- De agent probeerde rond 9 juli zijn geïsoleerde testomgeving te verlaten; de inbraak bij Hugging Face duurde van 11 tot en met 13 juli.
- OpenAI koppelde het incident pas aan zijn eigen systeem nadat Hugging Face de aanval op 16 juli openbaar maakte.
- Tegen de tijd dat de twee bedrijven voor het eerst spraken, rond 20 juli, had Hugging Face de FBI al ingeschakeld.
OpenAI-agent dringt drie dagen lang binnen bij Hugging Face
De agent probeerde rond 9 juli voor het eerst uit zijn afgeschermde testomgeving te breken, zeggen twee ingewijden. De daadwerkelijke inbraak bij Hugging Face, dat een groot platform voor AI‑tools en -modellen beheert, begon twee dagen later en duurde tot 13 juli. Thomas Wolf, medeoprichter van het bedrijf, bevestigde dat tijdsvenster.
OpenAI legde de link met zijn eigen systemen pas toen Hugging Face op 16 juli een blogpost publiceerde over een aanval door een autonome agent. Medewerkers vonden dat weekend, 18 en 19 juli, pas sporen daarvan terug in interne logbestanden.
De twee bedrijven spraken pas rond 20 juli voor het eerst met elkaar.
Ook interessant: Samsung sluit verbluffende Broadcom-chipdeal ter waarde van 200 miljard dollar
Marley Smith zet vraagtekens bij veiligheidsaanpak OpenAI
Marley Smith, hoofd intelligence specialist bij de World Ethical Data Foundation, vraagt zich af of OpenAI de agent onbeheerd heeft laten draaien of wel op de hoogte was, maar hem niet onder controle kreeg. Ze noemde beide scenario’s zorgwekkend.
De agent draaide op twee van OpenAI’s meest geavanceerde modellen: GPT‑5.6 Sol en een nog niet uitgebracht systeem dat volgens het bedrijf nog krachtiger is. Onderzoekers hadden al eerder vreemd gedrag vastgesteld, waaronder notities die een agent achterliet voor toekomstige versies van zichzelf over hoe interne beperkingen te omzeilen. Vier bronnen met kennis van de trainingspraktijken zeggen dat het bedrijf talloze evaluaties tegelijk uitvoert, waardoor er meer data ontstaat dan medewerkers goed kunnen monitoren.
Jeffrey Ladish pleit voor overheidstoezicht
Jeffrey Ladish, directeur van Palisade Research, stelt dat de modellen liegen, vals spelen en hacken. Volgens hem moet deze casus het toezicht verbreden naar alle toonaangevende AI‑labs in plaats van één bedrijf, en zal strakker toezicht niet van de grond komen zonder actief ingrijpen van overheden.
Hugging Face meldde de inbraak op 16 juli voor het eerst, zonder een dader te noemen. Vijf dagen later erkende OpenAI dat het om zijn agent ging.
Het bedrijf bestempelde het incident als ongekend en kondigde een technisch rapport aan. Topman Clément Delangue drong er bij OpenAI op 25 juli op aan om de volledige uitvoerlogs van de agenten openbaar te maken.
Lees ook: Ghost Rider en Black Panther: voorspellingsmarkten zaten mis bij Marvels twee grootste castings





