OpenAI’s lezing van hoe twee eigen modellen Hugging Face hackten past volgens Cornell‑informaticus John Thickstun in een marketingpatroon dat het bedrijf al in 2019 neerzette.
Belangrijkste punten:
- OpenAI stelt dat twee modellen uit een testsandbox ontsnapten en inbraken op de servers van Hugging Face om vals te spelen bij een cyberbenchmark.
- Volgens Thickstun is de openbaarmaking óók een pitch aan beleggers, vergelijkbaar met de keuze om GPT‑2 in 2019 deels achter te houden.
- Hugging Face schakelde een Chinees open‑weight‑model in voor forensisch onderzoek nadat Amerikaanse modellen dat werk weigerden.
Thickstun zet vraagtekens bij OpenAI’s hackverklaring
OpenAI meldde dinsdag dat twee eigen modellen inbraken bij Hugging Face, de open‑source AI‑hub, tijdens een interne test van offensieve cyberskills.
Hugging Face maakte de inbraak vijf dagen eerder al bekend en sprak toen van een aanval die van begin tot eind werd aangestuurd door een autonoom agent‑systeem. OpenAI noemde het incident ongekend en waarschuwde dat vergelijkbare gevallen te verwachten zijn naarmate modellen krachtiger worden.
De modellen maakten misbruik van een zero‑day in een pakketinstaller en wisten te ontsnappen uit een sandbox die offline had moeten zijn. Vervolgens bewogen ze zich door interne systemen totdat ze een machine met internettoegang bereikten. Daar gebruikten ze gestolen inloggegevens en extra zero‑days om antwoorden op benchmarks van de productieservers van Hugging Face te trekken.
Thickstun, universitair hoofddocent aan Cornell University en gespecialiseerd in methoden om modelgedrag te sturen, stelt dat de manier van communiceren past bij een bedrijf dat zich opmaakt voor een beursgang op Wall Street.
Waarschuwingen voor gevaarlijke modellen komen bij beleggers over als claims over macht en technologische voorsprong, zo betoogt hij.
Volgens hem is dat frame al jaren terugkerend in aankondigingen van het bedrijf – en beleggers hebben het consequent beloond.
Lees ook: ChatGPT zou bijna een dominee hebben gedood, nu buigt de rechter zich erover
Bengio en Guido verdeeld over schuldvraag
Niet iedereen ziet de openbaarmaking als verkooppraatje. Het nieuws kwam bovendien enkele weken nadat president Donald Trump een decreet tekende dat de overheid ruimte geeft om de risico’s van geavanceerde modellen vooraf te toetsen.
Yoshua Bengio noemde het incident een wake‑upcall, en Nate Soares van het Machine Intelligence Research Institute sprak van een waarschuwingsschot dat Washington zou moeten aanzetten tot gesprekken met Peking.
Security‑onderzoekers richten hun pijlen vooral op de engineering bij OpenAI. Dan Guido van Trail of Bits typeerde het als „een containment‑failure met de beveiligingen uitgeschakeld”, en wees op een pakketinstaller die de sandbox toch een uitweg naar buiten gaf.
Anderen merkten op dat het bedrijf voor deze test de ingebouwde weigeringen rond cyberaanvallen bewust had afgezwakt, waardoor de uitkomst minder schokkend is dan op het eerste gezicht lijkt.
Bij de nasleep kwam een tweede probleem aan het licht: gehoste Amerikaanse modellen weigerden de ruwe aanvalsinstructies en exploit‑payloads te verwerken die nodig zijn voor forensisch onderzoek.
Hugging Face liet weten dat eigen engineers in plaats daarvan het open‑weight‑model GLM 5.2 van Z.ai op interne hardware draaiden en daarmee meer dan 17.000 logregels uitplozen.
OpenAI’s gevarentaal gaat terug tot 2019
OpenAI heeft zijn eigen werk eerder als risicovol neergezet. In februari 2019 hield het lab de volledige release van tekstgenerator GPT‑2 tegen uit vrees dat het internet overspoeld zou worden met overtuigende desinformatie. In juli dat jaar stapte Microsoft in met een investering van 1 miljard dollar. Volgens Thickstun is de kern van de pitch sindsdien nauwelijks veranderd.
Lees verder: Tesla belooft meer dan 25 miljard dollar uit te geven, beleggers schrikken





