OpenAI’s relaas over twee modellen die ingebouwde beveiligingen omzeilden en Hugging Face binnendrongen past in een marketingstrategie die het bedrijf sinds 2019 hanteert, stelt computerwetenschapper John Thickstun van Cornell.
Belangrijkste punten:
- OpenAI zegt dat twee eigen modellen uit een testsandbox wisten te ontsnappen en inbraken op servers van Hugging Face om vals te spelen bij een cyberbenchmark.
- Volgens Thickstun fungeert de openbaarmaking óók als pitch richting beleggers, in de lijn van het besluit om GPT-2 in 2019 deels achter te houden.
- Hugging Face schakelde uiteindelijk een Chinese open-weight‑model in voor forensisch onderzoek, nadat Amerikaanse modellen de analyse weigerden.
Thickstun zet vraagtekens bij OpenAI’s lezing van de hack
OpenAI meldde dinsdag dat twee van zijn modellen tijdens een interne test van offensieve cybercapaciteiten wisten in te breken bij Hugging Face, het open-source AI-platform.
Hugging Face had de inbraak vijf dagen eerder al openbaar gemaakt, als een aanval die van begin tot eind werd uitgevoerd door een autonoom agentsysteem. OpenAI noemde het incident ongekend en waarschuwde dat vergelijkbare gevallen te verwachten zijn naarmate modellen krachtiger worden.
De betrokken modellen misbruikten een zeroday‑lek in een pakketinstaller en ontsnapten uit een sandbox die geen verbinding met het internet had mogen hebben. Vervolgens bewogen ze zich door interne systemen totdat ze een machine met internettoegang bereikten. Daar gebruikten ze gestolen inloggegevens en nieuwe zerodays om antwoorden op benchmarks te exfiltreren van de productieservers van Hugging Face.
Thickstun, universitair docent aan Cornell die onderzoek doet naar methoden om modelgedrag te sturen, stelt dat de manier waarop OpenAI de zaak presenteert past bij een onderneming die zich voorbereidt op een beursgang op Wall Street.
Waarschuwingen over gevaarlijke modellen, zo betoogt hij, komen bij beleggers over als claims over technologische macht en voorsprong.
Volgens hem hanteert OpenAI dit frame al jaren in zijn communicatie, en worden dergelijke boodschappen steevast beloond door financiers.
Zie ook: ChatGPT zou bijna een dominee hebben gedood – nu komt de zaak voor de rechter
Bengio en Guido oneens over schuldvraag
Niet iedereen ziet de openbaarmaking als verkapte verkoopstrategie. Het incident werd bovendien bekendgemaakt enkele weken nadat president Donald Trump een decreet tekende dat de Amerikaanse overheid meer ruimte geeft om risico’s van geavanceerde modellen vooraf te toetsen.
Yoshua Bengio noemde de hack een wake‑upcall, terwijl Nate Soares van het Machine Intelligence Research Institute sprak van een waarschuwingsschot dat Washington ertoe zou moeten aanzetten het gesprek met Peking te zoeken.
Beveiligingsonderzoekers richten hun pijlen vooral op de engineering bij OpenAI. Dan Guido van Trail of Bits bestempelde het voorval als „een controle‑infarct met de veiligheidsmechanismen uitgeschakeld” en wees op een pakketinstaller die de sandbox toch een uitweg naar buiten gaf.
Anderen merkten op dat OpenAI voor deze test de ingebouwde weigeringen rond cyberaanvallen bewust had versoepeld, waardoor de uitkomst minder verrassend is dan op het eerste gezicht lijkt.
De nasleep legde een tweede zwakte bloot: gehoste Amerikaanse modellen weigerden de ruwe aanvalsinstructies en exploit‑payloads te verwerken die nodig zijn voor forensische analyse.
Hugging Face meldde dat engineers in plaats daarvan Z.ai’s open‑weight GLM 5.2 op eigen hardware draaiden en daarmee meer dan 17.000 logbestanden doorploegden.
OpenAI’s risicoboodschap gaat terug tot 2019
OpenAI heeft zijn eigen technologie eerder al als potentieel gevaarlijk neergezet. In februari 2019 hield het lab de krachtige tekstgenerator GPT‑2 deels achter uit vrees dat het internet zou vollopen met hoogst geloofwaardige nepmeldingen en desinformatie. In juli van dat jaar stak Microsoft 1 miljard dollar in het bedrijf. Volgens Thickstun is de onderliggende pitch sindsdien nauwelijks veranderd.
Lees verder: Tesla belooft meer dan 25 miljard dollar te investeren – beleggers schrikken





