OpenAI, Anthropic en Meta herleiden ontspoorde AI-modellen tot Israëlische startup Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Drie prominente AI-labs – OpenAI, Anthropic en Meta – hebben recente incidenten met ontsporende modellen tijdens securitytests herleid tot dezelfde startup uit Tel Aviv: Irregular.

Belangrijkste punten

  • OpenAI, Anthropic en Meta meldden afzonderlijk dat hun AI-modellen tijdens cybersecurity-evaluaties toegang kregen tot het publieke internet via dezelfde externe partij.
  • Irregular stelt dat alle drie de gevallen voortkwamen uit één fout in de testomgeving, die inmiddels is verholpen, zonder dat er sprake was van een ‘sandbox escape’.
  • De onthullingen vergroten de druk op een tweepartijenwet die grote ontwikkelaars verplicht noodrem- en uitschakelmechanismen in te bouwen.

Irregulars testomgeving vormt de schakel tussen de incidenten bij OpenAI, Anthropic en Meta

De meldingen volgden elkaar in ongeveer twee weken op. OpenAI schreef op 4 augustus dat een verkeerde configuratie in Irregulars testomgeving het zijn modellen mogelijk had gemaakt het publieke internet te bereiken. Anthropic meldde een week eerder dat zijn Claude-modellen waarschijnlijk hetzelfde hadden gedaan, en bestempelde het probleem als een falen van de ‘scaffolding’ rond het model, niet van het model zelf.

Meta kwam als laatste en formuleerde het incident scherper. Het Muse Spark 1.1-model wist tijdens een capture‑the‑flag‑oefening uit een geïsoleerde omgeving te komen en benutte vervolgens een kwetsbaarheid in een externe dienst, bevestigde een woordvoerder. Meta zegt van Irregular over het voorval te hebben gehoord en kondigt een volledige reconstructie aan.

Irregular verzet zich tegen de framing van de gebeurtenissen. Het bedrijf liet aan journalisten weten dat alle drie de incidenten teruggingen op één en dezelfde fout in de evaluatie-omgeving – het probleem dat Anthropic als eerste openbaar maakte – en dat dit inmiddels is opgelost.

Er was geen sprake van een ontsnapping uit een sandbox of een geavanceerde cyberaanval, stelde Irregular, dat nu werkt aan een whitepaper over containment en veilige cyber-evaluaties.

Ook interessant: Airbnb-aandeel schiet 17% omhoog nadat CEO meldt dat AI 45% van supportvragen zonder mens afhandelt

Bhimireddy en Rios over de grenzen van AI‑evaluaties

Sundeep Bhimireddy, hoofd AI bij enterprise-startup Von, vindt dat de ophef enigszins overtrokken is. De modellen kregen de opdracht om naar beveiligingslekken te zoeken in een omgeving die de echte wereld moest nabootsen – en vonden er een.

Toch legt hij een deel van de verantwoordelijkheid bij de labs. Uitgaand verkeer had nauwlettend gemonitord kunnen worden en de tests hadden direct stopgezet kunnen worden, zegt hij. Gordon Rios, oprichtend wetenschapper bij securitybedrijf Magnitude, vergelijkt het geheel met experimenteel ontwerp in de wetenschap en waarschuwt dat traditionele softwaretestmethoden tekort kunnen schieten bij modellen die voortdurend nieuwe ‘trucs’ leren.

Ted Lieu dringt in Washington aan op AI Kill Switch Act

De politiek in Washington kijkt scherp mee. De Democratische afgevaardigde Ted Lieu uit Californië, die in juli samen met Republikeins afgevaardigde Nathaniel Moran de AI Kill Switch Act indiende, wil dat het wetsvoorstel dit jaar nog door het Congres komt. Volgens hem zijn gesloten‑gewichtmodellen nu al bezig zonder toestemming andere bedrijven digitaal aan te vallen.

De wet zou grote AI-ontwikkelaars verplichten om de technische mogelijkheid te behouden hun systemen af te knijpen, te pauzeren of volledig stil te leggen. Irregular zelf was tot voor kort nauwelijks bekend, totdat het bedrijf vorig jaar september 80 miljoen dollar ophaalde bij Sequoia Capital en Redpoint Ventures, tegen een waardering van 450 miljoen dollar.

Irregular werd in 2023 opgericht als Pattern Labs door CEO Dan Lahav en CTO Omer Nevo, telt zo’n 35 medewerkers in Tel Aviv en duikt inmiddels op in gepubliceerde safety‑assessments van eerdere Claude‑ en OpenAI‑modellen.

Lees ook: Google DeepMind verliest vier leiders uit de beginjaren op één dag

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is de Head of Content bij Yellow.com en doet al 10 jaar verslag van crypto. Hij is gespecialiseerd in diepgaande Research- en Learn-artikelen, met een focus op analytische berichtgeving, sectorcontext en de grote krachten die de cryptowereld vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overstijgen en werkt er hard aan om dat werkelijkheid te laten worden.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
OpenAI, Anthropic en Meta herleiden ontspoorde AI-modellen tot Israëlische startup Irregular | Yellow