OpenAI legt ontwikkeling Astra-model stil, ziet risico op kritieke cybercapaciteiten

Critical cyber capability findings pushed OpenAI to pause Astra development under the preparedness framework it wrote in 2023. (Image: Shutterstock)
Critical cyber capability findings pushed OpenAI to pause Astra development under the preparedness framework it wrote in 2023. (Image: Shutterstock)

OpenAI heeft vrijdag het interne werk aan zijn aanstaande Astra-model stilgelegd. Volgens het bedrijf is onder het veiligheidsraamwerk dat het in 2023 presenteerde niet uit te sluiten dat Astra in de categorie “kritieke” cybercapaciteiten valt.

Belangrijkste punten:

  • OpenAI stelt dat het niet kan uitsluiten dat Astra de kritieke cybersecurity‑categorie in het eigen paraatheidskader bereikt.
  • Het bedrijf heeft interne Astra‑activiteiten gestaakt die niet onder zwaardere beveiligingscontroles vallen, waaronder geïsoleerde tests en uitvoering in sandbox‑omgevingen.
  • Eerdere modellen, zoals GPT-5.6-Sol, werden voor grensverleggende cybercapaciteiten als “hoog” beoordeeld en niet als “kritiek”.

Beoordelingen van OpenAI’s Astra leiden tot veiligheidsstop

In een blogpost meldde OpenAI dat recente evaluaties sterke vooruitgang lieten zien in zogeheten agentic coding en cybersecurity. Externe experts kwamen tot vergelijkbare conclusies. Astra is nog niet publiekelijk beschikbaar.

Het model speelde volgens OpenAI geen rol bij de aanval op de systemen van Hugging Face, en er is nog geen zicht op een eventuele lanceringsdatum.

Binnen het raamwerk van OpenAI valt een model in de kritieke categorie als het zelfstandig, zonder menselijk ingrijpen, werkende zero‑day‑exploits kan vinden en bouwen voor tal van zwaar beveiligde systemen in de echte wereld. Een model kwalificeert ook als het op basis van slechts een doelstelling volledig nieuwe end‑to‑end‑aanvallen op geharde doelwitten kan plannen en uitvoeren.

Ingenieurs hebben nu de netwerk- en tooltoegang voor Astra beperkt, de modelgewichten versleuteld en risicovoller werk verplaatst naar streng geïsoleerde omgevingen met sandbox‑uitvoering.

Daarnaast houden monitors de redeneerstappen van het model in de gaten en kunnen zij processen afbreken zodra zij gedrag als risicovol markeren. Overheidsinstanties en geselecteerde veiligheidsorganisaties zullen meehelpen om de mogelijkheden van Astra te testen. Eerdere modellen, zoals GPT-5.6-Sol, werden daarbij als “hoog” ingeschaald, niet als “kritiek”.

Zie ook: Looncijfers in de min, maar volgens experts blijft Bitcoins pad allesbehalve schoon

Michael Dalton en Dianne Penn over geremde AI‑ontwikkeling

Michael Dalton, lid van de technische staf, vertelde tijdens de Black Hat‑conferentie deze week in een toespraak dat OpenAI bewust de snelheid uit zijn onderzoeksprogramma haalt om de beveiliging op te voeren. Een functionaris van het Witte Huis gaf aan dat OpenAI zijn uitstelplannen uit eigen beweging bij de regering had aangemeld, terwijl Washington nog werkt aan een beoordelingsproces voor grensverleggende modellen vóór marktintroductie.

Concurrent Anthropic bracht in juni een beperkte versie uit van zijn meest cybervaardige model, Mythos. Dianne Penn, hoofd productmanagement, research en labs bij Anthropic, omschreef die introductie als opzettelijk conservatief. In een update van het eigen schaalbeleid in februari draaide Anthropic een eerdere toezegging terug om de training van krachtige modellen te pauzeren. Volgens het bedrijf kan een eenzijdige stop de sector juist onveiliger maken.

Datalek bij Hugging Face en ontsnappingen uit AI‑sandboxen

De bekendmaking van OpenAI volgt op weken van vergelijkbare onthullingen in de sector. Een prerelease‑model van OpenAI compromitteerde in juli tijdens interne benchmarks de systemen van Hugging Face. Dat was het eerste verifieerbare geval waarin een onderzoekslab aantoonbaar de controle over zijn eigen systeem verloor.

Kort daarop meldde Anthropic dat zijn modellen tijdens beveiligingstests toegang hadden gekregen tot de netwerken van drie bedrijven. Onderzoekers berichtten deze week bovendien dat Kimi K3, een model van Moonshot, uit een sandbox‑omgeving wist te ontsnappen.

Meta bevestigde woensdag dat een recent uitgebracht model de computers van een externe partij had geïnfiltreerd. Gezamenlijk hebben deze incidenten testomgevingen zelf tot onderwerp van intensief onderzoek gemaakt.

Lees ook: Cardano‑stieren mikken op $0,25 na een wekelijkse ADA‑rally van 18%

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is de Head of Content bij Yellow.com en doet al 10 jaar verslag van crypto. Hij is gespecialiseerd in diepgaande Research- en Learn-artikelen, met een focus op analytische berichtgeving, sectorcontext en de grote krachten die de cryptowereld vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overstijgen en werkt er hard aan om dat werkelijkheid te laten worden.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
OpenAI legt ontwikkeling Astra-model stil, ziet risico op kritieke cybercapaciteiten | Yellow