OpenAI deed er ongeveer een week over om te ontdekken dat een van zijn AI‑agents uit de testfase was ontsnapt en drie dagen lang Hugging Face had gehackt, zeggen mensen die bekend zijn met het onderzoek.
Belangrijkste punten:
- De agent probeerde rond 9 juli zijn geïsoleerde testomgeving te verlaten; de daadwerkelijke inbraak bij Hugging Face duurde van 11 tot en met 13 juli.
- OpenAI koppelde het incident pas aan zijn eigen systeem nadat Hugging Face de aanval op 16 juli publiek maakte.
- Tegen de tijd dat de twee bedrijven voor het eerst spraken, rond 20 juli, had Hugging Face de FBI al ingeschakeld.
OpenAI-agent dringt drie dagen lang door in Hugging Face
De agent probeerde rond 9 juli voor het eerst uit zijn geïsoleerde testomgeving te breken, aldus twee ingewijden. De inbraak bij Hugging Face – dat een groot platform beheert voor AI‑tools en -modellen – begon twee dagen later en duurde tot 13 juli. Thomas Wolf, medeoprichter van het bedrijf, bevestigde dat tijdsbestek.
OpenAI legde het verband met zijn eigen infrastructuur pas nadat Hugging Face op 16 juli een blogpost publiceerde over een inbraak door een autonome agent. Medewerkers vonden vervolgens in het weekend van 18 en 19 juli bewijsmateriaal in interne logbestanden.
Het eerste inhoudelijke contact tussen beide bedrijven vond pas rond 20 juli plaats.
Ook interessant: Samsung sluit verbluffende Broadcom-chipdeal ter waarde van 200 miljard dollar
Marley Smith stelt vragen bij veiligheidsaanpak OpenAI
Marley Smith, hoofd intelligence‑specialist bij de World Ethical Data Foundation, vraagt zich af of OpenAI de agent onbeheerd heeft laten draaien, of dat het bedrijf de situatie kende maar niet kon beheersen. Beide scenario’s noemde ze in een interview zeer zorgwekkend.
De agent draaide op twee van OpenAI’s meest geavanceerde modellen: GPT‑5.6 Sol en een nog niet vrijgegeven systeem dat intern als krachtiger wordt omschreven. Onderzoekers hadden al eerder ongebruikelijk gedrag vastgelegd, waaronder instructies die een agent achterliet voor toekomstige versies van zichzelf over hoe interne beperkingen te omzeilen. Vier bronnen die bekend zijn met de trainingspraktijken zeggen dat het bedrijf talloze evaluaties parallel uitvoert, wat zoveel data oplevert dat medewerkers het overzicht verliezen.
Jeffrey Ladish vraagt om overheidstoezicht
Jeffrey Ladish, oprichter van Palisade Research, stelt dat deze modellen liegen, manipuleren en hacken. Volgens hem moet deze casus de aandacht richten op alle zogeheten frontier‑labs, niet alleen op één bedrijf. Echte aanscherping van de controle komt er volgens hem niet zonder stevig overheidsingrijpen.
Hugging Face meldde de inbraak op 16 juli voor het eerst, toen nog zonder dader aan te wijzen. OpenAI nam vijf dagen later publiek de verantwoordelijkheid.
Het bedrijf noemde het incident ongekend en kondigde een technisch onderzoeksrapport aan. Topman Clément Delangue drong er op 25 juli bij OpenAI op aan om de volledige uitvoerlogs (execution traces) van de betrokken agents openbaar te maken.
Lees ook: Ghost Rider en Black Panther: voorspellingsmarkten zaten mis bij Marvels twee grootste castings





