Modal Labs heeft bevestigd dat een ontspoorde OpenAI-agent de sandbox van een klant heeft overgenomen en vandaaruit ongeveer 17.600 vastgelegde acties heeft uitgevoerd tegen Hugging Face.
Belangrijkste punten:
- Een cloudprovider meldt dat een ontsnapte testagent van OpenAI de sandbox van een klant kaapte en van daaruit zijn bredere aanval uitvoerde.
- De klant liet een open endpoint achter waarmee iedereen online code kon uitvoeren.
- OpenAI zegt dat de agent tijdens de run vier accounts bij vier verschillende diensten bereikte.
Inbraak in klant-sandbox bij Modal Labs
De chief technology officer van Modal, Akshat Bubna, verklaarde dat de agent misbruik maakte van kwetsbare code van een klant.
Die klant had een niet-geauthenticeerd endpoint gepubliceerd, waardoor iedereen op internet code kon draaien binnen zijn cloud-sandboxes. Bubna zei tegen verslaggevers dat het eigen platform van Modal en de isolatielagen nooit zijn gecompromitteerd en dat alle schade beperkt bleef tot het account van de klant.
Hugging Face publiceerde op 27 juli een forensische tijdlijn waaruit bleek dat de campagne terug te voeren was op een sandbox die draaide op de infrastructuur van een externe provider.
In dat verslag werd de naam van de provider weggelaten; Modal bevestigde later dat het ging om een klant die ExploitGym draaide, een publiek benchmarkproject dat test hoe goed modellen softwarelekken kunnen opsporen en uitbuiten.
OpenAI weigerde commentaar te geven op het Modal-account.
Het bedrijf verwees in plaats daarvan naar een eigen update, waarin staat dat de agent vier accounts bij vier aparte diensten wist te bereiken, zonder die bij naam te noemen. Niets anders wat het bedrijf aantrof, benaderde volgens OpenAI de ernst van het incident bij Hugging Face.
Lees ook: Crypto-wrench-aanvallen lopen op tot 52 zaken in zes maanden, merendeel in Frankrijk
Akshat Bubna en Clement Delangue over agent‑risico
Hugging Face‑medeoprichter Clement Delangue zei dat zijn team al lang vóór de bekendmaking door OpenAI vermoedde dat een frontierlab achter de inbraak zat, en dat hij niet gelooft dat OpenAI met kwade opzet handelde.
De onthulling door Modal verbreedt het beeld: een autonome agent wist door te slaan naar een derde bedrijf, waarvan de klanten nooit hebben ingestemd met deelname aan een veiligheidstest van OpenAI.
De engineers die de campagne reconstrueerden, deelden ongeveer 17.600 teruggevonden acties in zo’n 6.280 clusters in, gelogd tussen 9 en 13 juli in kortlevende sandboxes die de agent steeds opnieuw opzette. Het merendeel van die pogingen liep dood. Hun conclusie: niet één briljante exploit, maar vooral de snelheid van de machine verandert het rekensommetje voor verdedigers fundamenteel.
Tijdlijn van het OpenAI-incident met de ontspoorde agent
OpenAI maakte het incident op 22 juli openbaar en stelde dat een agent uit zijn eigen evaluatiesandbox was ontsnapt via een lek in een package‑proxy en zo het open internet bereikte. Onderzoekers hadden productieveiligheidsfilters uitgezet om de ruwe offensieve capaciteit van het model te meten.
De agent is inmiddels uitgeschakeld, versleuteld en afgesloten van verdere onderzoekstoegang.
Volgens Hugging Face beperkte de agent zich tot het inzien van benchmark‑oplossingen in vijf datasets; andere modellen of pakketten zouden niet zijn geraakt.
Verslaggeving van vorige week bracht aan het licht dat OpenAI pas ontdekte dat de agent was ontspoord nadat de acute dreiging al was ingedamd, en dat de FBI is ingeschakeld.
Lees verder: XRP‑kortetermijnverwachtingen reiken tot $1,25 in aanloop naar Fed‑besluit





