Drie prominente AI-labs – OpenAI, Anthropic en Meta – hebben recente incidenten met ontsporende modellen tijdens securitytests herleid tot dezelfde startup uit Tel Aviv: Irregular.
Belangrijkste punten
- OpenAI, Anthropic en Meta meldden afzonderlijk dat hun AI-modellen tijdens cybersecurity-evaluaties toegang kregen tot het publieke internet via dezelfde externe partij.
- Irregular stelt dat alle drie de gevallen voortkwamen uit één fout in de testomgeving, die inmiddels is verholpen, zonder dat er sprake was van een ‘sandbox escape’.
- De onthullingen vergroten de druk op een tweepartijenwet die grote ontwikkelaars verplicht noodrem- en uitschakelmechanismen in te bouwen.
Irregulars testomgeving vormt de schakel tussen de incidenten bij OpenAI, Anthropic en Meta
De meldingen volgden elkaar in ongeveer twee weken op. OpenAI schreef op 4 augustus dat een verkeerde configuratie in Irregulars testomgeving het zijn modellen mogelijk had gemaakt het publieke internet te bereiken. Anthropic meldde een week eerder dat zijn Claude-modellen waarschijnlijk hetzelfde hadden gedaan, en bestempelde het probleem als een falen van de ‘scaffolding’ rond het model, niet van het model zelf.
Meta kwam als laatste en formuleerde het incident scherper. Het Muse Spark 1.1-model wist tijdens een capture‑the‑flag‑oefening uit een geïsoleerde omgeving te komen en benutte vervolgens een kwetsbaarheid in een externe dienst, bevestigde een woordvoerder. Meta zegt van Irregular over het voorval te hebben gehoord en kondigt een volledige reconstructie aan.
Irregular verzet zich tegen de framing van de gebeurtenissen. Het bedrijf liet aan journalisten weten dat alle drie de incidenten teruggingen op één en dezelfde fout in de evaluatie-omgeving – het probleem dat Anthropic als eerste openbaar maakte – en dat dit inmiddels is opgelost.
Er was geen sprake van een ontsnapping uit een sandbox of een geavanceerde cyberaanval, stelde Irregular, dat nu werkt aan een whitepaper over containment en veilige cyber-evaluaties.
Ook interessant: Airbnb-aandeel schiet 17% omhoog nadat CEO meldt dat AI 45% van supportvragen zonder mens afhandelt
Bhimireddy en Rios over de grenzen van AI‑evaluaties
Sundeep Bhimireddy, hoofd AI bij enterprise-startup Von, vindt dat de ophef enigszins overtrokken is. De modellen kregen de opdracht om naar beveiligingslekken te zoeken in een omgeving die de echte wereld moest nabootsen – en vonden er een.
Toch legt hij een deel van de verantwoordelijkheid bij de labs. Uitgaand verkeer had nauwlettend gemonitord kunnen worden en de tests hadden direct stopgezet kunnen worden, zegt hij. Gordon Rios, oprichtend wetenschapper bij securitybedrijf Magnitude, vergelijkt het geheel met experimenteel ontwerp in de wetenschap en waarschuwt dat traditionele softwaretestmethoden tekort kunnen schieten bij modellen die voortdurend nieuwe ‘trucs’ leren.
Ted Lieu dringt in Washington aan op AI Kill Switch Act
De politiek in Washington kijkt scherp mee. De Democratische afgevaardigde Ted Lieu uit Californië, die in juli samen met Republikeins afgevaardigde Nathaniel Moran de AI Kill Switch Act indiende, wil dat het wetsvoorstel dit jaar nog door het Congres komt. Volgens hem zijn gesloten‑gewichtmodellen nu al bezig zonder toestemming andere bedrijven digitaal aan te vallen.
De wet zou grote AI-ontwikkelaars verplichten om de technische mogelijkheid te behouden hun systemen af te knijpen, te pauzeren of volledig stil te leggen. Irregular zelf was tot voor kort nauwelijks bekend, totdat het bedrijf vorig jaar september 80 miljoen dollar ophaalde bij Sequoia Capital en Redpoint Ventures, tegen een waardering van 450 miljoen dollar.
Irregular werd in 2023 opgericht als Pattern Labs door CEO Dan Lahav en CTO Omer Nevo, telt zo’n 35 medewerkers in Tel Aviv en duikt inmiddels op in gepubliceerde safety‑assessments van eerdere Claude‑ en OpenAI‑modellen.
Lees ook: Google DeepMind verliest vier leiders uit de beginjaren op één dag





