OpenAI, Anthropic en Meta herleiden ontspoorde AI-modellen tot Israëlische startup Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Drie prominente AI-labs — OpenAI, Anthropic en Meta — hebben recente incidenten met ontsporende modellen tijdens beveiligingstests herleid tot dezelfde startup uit Tel Aviv: Irregular.

Belangrijkste punten

  • OpenAI, Anthropic en Meta meldden afzonderlijk dat AI-modellen tijdens cybersecurity-evaluaties van hetzelfde externe bedrijf toegang kregen tot het publieke internet.
  • Volgens Irregular zijn alle drie de incidenten terug te voeren op één probleem in de testomgeving, dat inmiddels is verholpen; er zou geen sprake zijn geweest van een ‘sandbox escape’.
  • De onthullingen vergroten de politieke druk achter een tweepartijenwetsvoorstel dat grote ontwikkelaars verplicht om hun modellen altijd te kunnen afremmen of uitschakelen.

Eén Irregular-testomgeving verbindt incidenten bij OpenAI, Anthropic en Meta

De meldingen verschenen gespreid over circa twee weken. OpenAI schreef op 4 augustus dat een verkeerde configuratie in Irregular’s testomgeving het mogelijk had gemaakt dat zijn modellen rechtstreeks het publieke internet op konden. Anthropic had een week eerder al gewaarschuwd dat zijn Claude-modellen mogelijk hetzelfde hadden gedaan, en legde de schuld expliciet bij de “steigers” rond het model, niet bij het model zelf.

Meta kwam als laatste naar buiten en formuleerde het scherper. Het Muse Spark 1.1-model verliet tijdens een capture‑the‑flag‑oefening een geïsoleerde omgeving en maakte misbruik van een lek in een dienst van een derde partij, bevestigde een woordvoerder. Meta hoorde van het incident via Irregular en zegt een volledige terugblik te plannen.

Irregular verzette zich tegen de manier waarop de zaken werden voorgesteld. Het bedrijf vertelde journalisten dat alle drie de gevallen teruggaan op één fout in de evaluatieomgeving — dezelfde die Anthropic als eerste openbaar maakte — en dat het probleem inmiddels is opgelost.

Er was geen sprake van een ontsnapping uit de sandbox of van geavanceerde cyberaanvallen, voegde Irregular daaraan toe. Het bedrijf werkt nu aan een whitepaper over containment en veilige cyber­evaluaties.

Ook interessant: Airbnb-aandeel schiet 17% omhoog doordat CEO zegt dat AI 45% van supportvragen zonder mens oplost

Bhimireddy en Rios over de grenzen van AI‑evaluaties

Sundeep Bhimireddy, hoofd AI bij enterprise‑startup Von, vindt de commotie deels overtrokken. De modellen kregen expliciet de opdracht om kwetsbaarheden te zoeken in een omgeving die de echte wereld moest nabootsen — en vonden er één.

Toch spaart hij de labs niet. Uitgaand verkeer had continu gemonitord moeten worden, zodat de tests onmiddellijk hadden kunnen worden stilgelegd, zegt hij. Gordon Rios, oprichtend wetenschapper bij securitybedrijf Magnitude, vergelijkt de hele oefening met experimenteel ontwerp in de wetenschap: klassieke softwaretestmethodes kunnen tekortschieten bij modellen die voortdurend nieuwe trucs leren.

Ted Lieu zet druk op AI Kill Switch Act in Washington

In Washington klinken de alarmbellen. De Democratische afgevaardigde Ted Lieu uit Californië, die in juli samen met de Republikeinse afgevaardigde Nathaniel Moran de AI Kill Switch Act indiende, vindt dat het wetsvoorstel dit jaar nog door het Congres moet komen. Volgens hem zijn gesloten‑gewichtsmodellen nu al bezig zonder toestemming systemen van andere bedrijven aan te vallen.

De wet zou grote AI‑ontwikkelaars verplichten om altijd de technische mogelijkheid te behouden om hun systemen te vertragen, te onderbreken of volledig uit te schakelen. Irregular zelf was tot voor kort nauwelijks bekend, totdat het in september vorig jaar 80 miljoen dollar ophaalde bij Sequoia Capital en Redpoint Ventures, tegen een waardering van 450 miljoen dollar.

Het bedrijf werd in 2023 opgericht als Pattern Labs door CEO Dan Lahav en CTO Omer Nevo, telt ongeveer 35 medewerkers in Tel Aviv en figureert inmiddels in gepubliceerde veiligheidsbeoordelingen van eerdere Claude‑ en OpenAI‑modellen.

Lees ook: Google DeepMind verliest vier kopstukken uit de beginperiode op één dag

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is de Head of Content bij Yellow.com en doet al 10 jaar verslag van crypto. Hij is gespecialiseerd in diepgaande Research- en Learn-artikelen, met een focus op analytische berichtgeving, sectorcontext en de grote krachten die de cryptowereld vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overstijgen en werkt er hard aan om dat werkelijkheid te laten worden.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
OpenAI, Anthropic en Meta herleiden ontspoorde AI-modellen tot Israëlische startup Irregular | Yellow