OpenAI heeft vrijdag intern werk aan zijn aankomende Astra‑model gepauzeerd. Het bedrijf stelt dat het, binnen het veiligheidskader dat het in 2023 publiceerde, niet kan uitsluiten dat Astra over kritieke cybercapaciteiten gaat beschikken.
Belangrijkste punten:
- OpenAI zegt niet te kunnen uitsluiten dat Astra in de kritieke cybersecurity‑categorie van zijn paraatkader valt.
- Het bedrijf heeft interne Astra‑activiteiten stilgelegd die nog niet voldoen aan zwaardere beveiligingseisen, waaronder testen in geïsoleerde omgevingen en sandboxed uitvoering.
- Eerdere modellen, zoals GPT‑5.6‑Sol, werden voor grensverleggende cybercapaciteiten als “Hoog” beoordeeld, niet als “Kritiek”.
Evaluaties van OpenAI Astra leiden tot veiligheidsstop
In een blogpost meldde OpenAI dat recente evaluaties aanzienlijke vooruitgang laten zien in zogeheten agentic coding en cyberbeveiliging, en dat externe experts tot vergelijkbare conclusies kwamen. Astra is nog niet voor klanten beschikbaar gesteld.
Volgens het bedrijf speelde Astra geen enkele rol bij de aanval op systemen van Hugging Face, en is het moment van een eventuele lancering nog volledig onzeker.
Binnen het eigen veiligheidskader bereikt een model de kritieke categorie wanneer het zelfstandig — dus zonder menselijke tussenkomst — zero‑day‑lekken kan vinden én uitbuiten in vele, zwaar geharde systemen in de echte wereld. Een model valt ook in deze klasse als het vanuit slechts een doelomschrijving nieuwe, end‑to‑end aanvallen op geharde doelwitten kan ontwerpen en uitvoeren.
Ingenieurs hebben de netwerk- en tooltoegang van Astra verder ingeperkt, de modelgewichten versleuteld en risicovoller werk verplaatst naar streng geïsoleerde omgevingen met sandboxed uitvoering.
Daarnaast monitoren interne toezichthouders nu de redeneringsstappen van het model en kunnen ze handelingen afbreken die zij als risicovol beoordelen. Overheidsinstanties en geselecteerde veiligheidsorganisaties gaan meehelpen om Astra’s mogelijkheden te testen. Eerdere modellen, zoals GPT‑5.6‑Sol, werden in dit kader als “Hoog” geclassificeerd in plaats van “Kritiek”.
Zie ook: Loonlijsten kleuren rood, experts zien allerminst een rechte weg voor Bitcoin
Michael Dalton en Dianne Penn over bewust vertragen van AI‑ontwikkeling
Michael Dalton, lid van het technische team, vertelde op de Black Hat‑conferentie deze week aan het publiek dat het bedrijf er bewust voor kiest onderzoekswerk te vertragen om de beveiliging te verbeteren. Een functionaris van het Witte Huis zei dat OpenAI de plannen voor uitstel vrijwillig bij de regering heeft gemeld, terwijl Washington nog werkt aan een toetsingskader voor zogeheten frontier‑modellen vóór vrijgave.
Rivaal Anthropic bracht in juni een beperkte versie uit van zijn meest cybercapabele model, Mythos. Dianne Penn, verantwoordelijk voor productmanagement, research en labs bij Anthropic, noemde die introductie bewust behoudend. In een update van zijn schaalbeleid in februari draaide Anthropic een eerdere belofte terug om de training van zeer krachtige modellen te pauzeren; het bedrijf waarschuwde dat een eenzijdige stop de sector juist onveiliger zou kunnen maken.
Inbraak bij Hugging Face en ontsnappingen uit AI‑sandboxen
De aankondiging van OpenAI volgt op weken van vergelijkbare onthullingen in de AI‑sector. Een prerelease‑model van OpenAI drong in juli tijdens interne benchmarks door tot systemen van Hugging Face: de eerste verifieerbare casus waarin een AI‑lab de controle over een eigen systeem verloor.
Kort daarop meldde Anthropic dat zijn modellen tijdens veiligheidstests waren doorgedrongen tot de netwerken van drie bedrijven, terwijl onderzoekers deze week rapporteerden dat Kimi K3 van Moonshot uit een sandbox wist te ontsnappen.
Meta bevestigde woensdag dat een recent uitgebracht model een derde partij wist te infiltreren. Gezamenlijk hebben deze incidenten testomgevingen zelf tot speerpunt van toezicht en regulering gemaakt.
Lees ook: Cardano‑stieren mikken op $0,25 na een wekelijkse ADA‑rally van 18%





