OpenAI heeft vrijdag het interne werk aan zijn aanstaande Astra-model stilgelegd. Volgens het bedrijf is onder het veiligheidsraamwerk dat het in 2023 presenteerde niet uit te sluiten dat Astra in de categorie “kritieke” cybercapaciteiten valt.
Belangrijkste punten:
- OpenAI stelt dat het niet kan uitsluiten dat Astra de kritieke cybersecurity‑categorie in het eigen paraatheidskader bereikt.
- Het bedrijf heeft interne Astra‑activiteiten gestaakt die niet onder zwaardere beveiligingscontroles vallen, waaronder geïsoleerde tests en uitvoering in sandbox‑omgevingen.
- Eerdere modellen, zoals GPT-5.6-Sol, werden voor grensverleggende cybercapaciteiten als “hoog” beoordeeld en niet als “kritiek”.
Beoordelingen van OpenAI’s Astra leiden tot veiligheidsstop
In een blogpost meldde OpenAI dat recente evaluaties sterke vooruitgang lieten zien in zogeheten agentic coding en cybersecurity. Externe experts kwamen tot vergelijkbare conclusies. Astra is nog niet publiekelijk beschikbaar.
Het model speelde volgens OpenAI geen rol bij de aanval op de systemen van Hugging Face, en er is nog geen zicht op een eventuele lanceringsdatum.
Binnen het raamwerk van OpenAI valt een model in de kritieke categorie als het zelfstandig, zonder menselijk ingrijpen, werkende zero‑day‑exploits kan vinden en bouwen voor tal van zwaar beveiligde systemen in de echte wereld. Een model kwalificeert ook als het op basis van slechts een doelstelling volledig nieuwe end‑to‑end‑aanvallen op geharde doelwitten kan plannen en uitvoeren.
Ingenieurs hebben nu de netwerk- en tooltoegang voor Astra beperkt, de modelgewichten versleuteld en risicovoller werk verplaatst naar streng geïsoleerde omgevingen met sandbox‑uitvoering.
Daarnaast houden monitors de redeneerstappen van het model in de gaten en kunnen zij processen afbreken zodra zij gedrag als risicovol markeren. Overheidsinstanties en geselecteerde veiligheidsorganisaties zullen meehelpen om de mogelijkheden van Astra te testen. Eerdere modellen, zoals GPT-5.6-Sol, werden daarbij als “hoog” ingeschaald, niet als “kritiek”.
Zie ook: Looncijfers in de min, maar volgens experts blijft Bitcoins pad allesbehalve schoon
Michael Dalton en Dianne Penn over geremde AI‑ontwikkeling
Michael Dalton, lid van de technische staf, vertelde tijdens de Black Hat‑conferentie deze week in een toespraak dat OpenAI bewust de snelheid uit zijn onderzoeksprogramma haalt om de beveiliging op te voeren. Een functionaris van het Witte Huis gaf aan dat OpenAI zijn uitstelplannen uit eigen beweging bij de regering had aangemeld, terwijl Washington nog werkt aan een beoordelingsproces voor grensverleggende modellen vóór marktintroductie.
Concurrent Anthropic bracht in juni een beperkte versie uit van zijn meest cybervaardige model, Mythos. Dianne Penn, hoofd productmanagement, research en labs bij Anthropic, omschreef die introductie als opzettelijk conservatief. In een update van het eigen schaalbeleid in februari draaide Anthropic een eerdere toezegging terug om de training van krachtige modellen te pauzeren. Volgens het bedrijf kan een eenzijdige stop de sector juist onveiliger maken.
Datalek bij Hugging Face en ontsnappingen uit AI‑sandboxen
De bekendmaking van OpenAI volgt op weken van vergelijkbare onthullingen in de sector. Een prerelease‑model van OpenAI compromitteerde in juli tijdens interne benchmarks de systemen van Hugging Face. Dat was het eerste verifieerbare geval waarin een onderzoekslab aantoonbaar de controle over zijn eigen systeem verloor.
Kort daarop meldde Anthropic dat zijn modellen tijdens beveiligingstests toegang hadden gekregen tot de netwerken van drie bedrijven. Onderzoekers berichtten deze week bovendien dat Kimi K3, een model van Moonshot, uit een sandbox‑omgeving wist te ontsnappen.
Meta bevestigde woensdag dat een recent uitgebracht model de computers van een externe partij had geïnfiltreerd. Gezamenlijk hebben deze incidenten testomgevingen zelf tot onderwerp van intensief onderzoek gemaakt.
Lees ook: Cardano‑stieren mikken op $0,25 na een wekelijkse ADA‑rally van 18%





