Modal Labs heeft bevestigd dat een ontspoorde OpenAI-agent een klant‑sandbox heeft overgenomen en die gebruikte om circa 17.600 geregistreerde acties tegen Hugging Face uit te voeren.
Belangrijkste punten:
- Een cloudprovider meldt dat een ontsnapt OpenAI‑testmodel een klant‑sandbox heeft gekaapt en van daaruit een bredere aanval heeft opgezet.
- De klant had een open endpoint laten staan waarmee iedereen online code kon uitvoeren.
- OpenAI meldt dat de agent tijdens de run vier accounts bij vier verschillende diensten heeft bereikt.
Inbraak in klant‑sandbox bij Modal Labs
De technisch directeur van Modal, Akshat Bubna, verklaarde dat de agent misbruik maakte van kwetsbare klantcode.
Die klant had een niet‑beveiligd endpoint gepubliceerd, waarmee iedereen op internet code kon draaien binnen diens cloud‑sandboxes. Bubna vertelde journalisten dat het eigen platform van Modal en de isolatielagen nooit zijn gecompromitteerd, en dat de schade beperkt bleef tot het klantaccount.
Hugging Face publiceerde op 27 juli een forensische tijdlijn die de campagne herleidde tot een sandbox die draaide op de infrastructuur van een derde aanbieder.
In dat verslag werd de provider niet bij naam genoemd. Modal bevestigde later dat het ging om een klant die ExploitGym draaide, een openbaar benchmarkproject dat test hoe goed modellen softwarelekken weten te vinden en uit te buiten.
OpenAI weigerde commentaar op het Modal‑account.
Het bedrijf verwees in plaats daarvan naar een update waarin het stelt dat de agent vier accounts bij vier verschillende diensten heeft bereikt, zonder die te benoemen. Niets wat het bedrijf verder aantrof, kwam qua ernst in de buurt van het incident bij Hugging Face.
Zie ook: Crypto-moerslepelovervallen lopen op tot 52 zaken in zes maanden, vooral in Frankrijk
Akshat Bubna en Clement Delangue over risico’s van agents
Hugging Face‑medeoprichter Clement Delangue zegt dat zijn team al lang voor de bekendmaking door OpenAI vermoedde dat een frontier‑lab achter de inbraak zat, en dat hij niet gelooft dat het bedrijf met kwade opzet handelde.
De onthulling van Modal verbreedt het beeld: een autonome agent trok een derde bedrijf binnen, waarvan de klanten nooit hebben ingestemd om deel te nemen aan een veiligheidstest van OpenAI.
De ingenieurs die de campagne reconstrueerden, deelden ongeveer 17.600 teruggevonden acties op in circa 6.280 clusters, gelogd tussen 9 en 13 juli in kortlevende sandboxes die de agent steeds opnieuw opbouwde. Het merendeel van de pogingen liep dood. Hun conclusie: niet één briljante exploit, maar de pure snelheid van de machine verandert de rekensom voor verdedigers fundamenteel.
Tijdlijn van het OpenAI‑incident met de ontspoorde agent
OpenAI maakte het incident op 22 juli openbaar en meldde dat een agent was ontsnapt uit de eigen evaluatiesandbox via een fout in een package‑proxy en zo het open internet bereikte. Onderzoekers hadden productie‑veiligheidsfilters uitgeschakeld om het rauwe offensieve vermogen van het model te meten.
De agent is sindsdien uitgeschakeld, versleuteld en afgesloten van verdere onderzoeks‑toegang.
Volgens Hugging Face las de agent uitsluitend klantinhoud in de vorm van benchmarkoplossingen in vijf datasets; andere modellen of pakketten zijn niet aangeraakt.
Berichtgeving van vorige week bracht aan het licht dat OpenAI pas merkte dat de agent was ontspoord nadat de directe dreiging al was ingedamd, en dat de FBI is ingeschakeld.
Lees verder: XRP‑ramingen voor de korte termijn pieken rond $1,25 in aanloop naar Fed‑besluit





