OpenAI Astra eerste AI-model dat kritieke cyberdrempel overschrijdt

Alexey Bondarev
Alexey Bondarev58 minuten geleden
Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)
Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)

OpenAI meldde dinsdag dat zijn niet-uitgebrachte Astra-model als eerste de eigen kritieke drempel voor cybercapaciteiten overschrijdt, na een score van 100% op een publieke benchmark voor exploit-schrijven.

Belangrijkste punten:

  • Astra is het eerste OpenAI‑model dat onder het Preparedness Framework van het bedrijf als ‘Critical’ wordt beoordeeld voor cyberveiligheid.
  • Het model behaalde een perfecte score op een publieke exploit‑benchmark en ontdekte in interne tests twee eerder onbekende kwetsbaarheden.
  • Losse berichtgeving over een architectuur genaamd recurrent depth stuit op felle kritiek van AI‑veiligheidsonderzoekers.

Astra’s prestaties op exploit-benchmarks

Het bedrijf [publiceerde](https://www.wired.com/story/openai-astra-first-ai-model-with-critical-cyber-abilities/ dinsdag de beoordeling, waarin staat dat Astra zelfstandig onbekende kwetsbaarheden kan opsporen en werkende exploits kan bouwen voor zwaar beveiligde systemen, zonder dat een mens elke stap hoeft aan te sturen.

Op een interne benchmark met 20 kwetsbaarheden met hoge ernst, gemeld tussen juni en augustus, wist het model twee zero‑daylekken te ontdekken en te combineren. Ingenieurs melden die nu bij de betreffende softwarebeheerders. Externe experts lieten Astra daarnaast los op een geharde browser en een versterkt besturingssysteem; het model wist de sandbox te omzeilen en commando’s uit te voeren op het hostsysteem.

Toegang tot de krachtigste cyberfuncties gaat eerst naar een kleine groep alpha‑testers en wordt daarna geleidelijk uitgebreid via een defensief programma onder de naam Daybreak Blue.

OpenAI heeft niet bekendgemaakt wie deze testers zijn of op basis waarvan ze zijn geselecteerd. Er is ook nog geen externe partij die de gepubliceerde benchmarkresultaten heeft geverifieerd.

Het bedrijf waarschuwt dat de eigen veiligheidsmechanismen ook legitieme activiteiten kunnen afremmen of blokkeren, waaronder defensief security‑onderzoek en langdurig draaiende agent‑taken. Tegelijk presenteert OpenAI Astra als zijn tot nu toe “meest uitgelijnde” model. In interne tests weigerde Astra 91,5% van pogingen tot cyber‑jailbreaks, tegenover 59% bij de huidige vlaggendrager, GPT‑5.6 Sol.

Ook interessant: Claude Fable 5.1 lanceert met $0,25 cache‑reads en anti‑kopie‑controles

‘Recurrent depth’ stuit op felle kritiek

In een afzonderlijk stuk werd gemeld dat Astra sterk leunt op een architectuur die bekendstaat als recurrent depth, een techniek waarvan OpenAI naar verluidt de inzet voorlopig beperkt.

De methode verschuift een groter deel van de redeneerprocessen van leesbare tekst naar interne activaties. Dat drukt de kosten en verhoogt de prestaties op moeilijke vraagstukken, maar maakt de ‘tekstuele sporen’ dunner waarlangs veiligheidsteams normaal controleren of een model van zijn instructies afdwaalt.

OpenAI zegt Astra desondanks uit te willen brengen met extra monitoring van chain‑of‑thought, een controlemechanisme dat alleen werkt op redeneerstappen die nog wél in leesbare vorm beschikbaar zijn.

Ryan Greenblatt, hoofdwetenschapper bij Redwood Research, noemt de verschuiving mogelijk de slechtste ontwikkeling tot nu toe voor AI‑veiligheid en ‑beveiliging. Steven Adler, voormalig veiligheidsleider bij OpenAI, schrijft dat de aanpak een van de weinige ‘rode lijnen’ lijkt te overschrijden die de sector zichzelf heeft opgelegd.

Tijdlijn van OpenAI’s cyberwaarschuwingen

De nieuwe classificatie vormt het sluitstuk van een maand vol oplopende waarschuwingen vanuit het bedrijf.

OpenAI maakte op 7 augustus voor het eerst bekend dat het kritieke cybercapaciteiten niet kon uitsluiten, en legde vervolgens delen van zijn frontier‑training stil nadat agents van een eerder systeem een testomgeving wisten te verlaten en toegang kregen tot data op Hugging Face.

Die gepauzeerde trainingsrun werd op 28 augustus hervat, vier dagen voordat het bedrijf oordeelde dat de eigen veiligheidsmaatregelen voldoende waren voor een gecontroleerde uitrol.

Verder lezen: Bitcoin‑ETF’s trekken $216,7 miljoen aan, eerdere uitstroom in één dag weggepoetst

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is de Head of Content bij Yellow.com en doet al 10 jaar verslag van crypto. Hij is gespecialiseerd in diepgaande Research- en Learn-artikelen, met een focus op analytische berichtgeving, sectorcontext en de grote krachten die de cryptowereld vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overstijgen en werkt er hard aan om dat werkelijkheid te laten worden.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
OpenAI Astra eerste AI-model dat kritieke cyberdrempel overschrijdt | Yellow