OpenAI’s Astra lijkt minder van zijn redeneringen expliciet in tekst te tonen. Dat wakkert opnieuw de zorgen aan uit een monitorability-paper uit 2025, mede geschreven door chief scientist Jakub Pachocki.
Belangrijkste punten:
- Astra lijkt een groter deel van zijn redeneerwerk intern af te handelen, wat vragen oproept of toezichthouders problematisch gedrag nog tijdig kunnen signaleren.
- Ryan Greenblatt en Pachocki schreven in juli 2025 mee aan een paper die concludeerde dat “chain-of-thought monitorability” een kwetsbare maar cruciale kans voor AI-veiligheid is.
- Ondertekenaars van de EU-gedragscode voor algemene AI-systemen moeten modelveiligheidsrapporten indienen bij het AI Office, inclusief evaluatiebewijzen voor onafhankelijk toezicht.
Astra en monitorability
Semafor meldde dat Astra meer redeneert zonder die tussenstappen nog in zichtbare tekst vrij te geven. Daardoor rijst de vraag of toezichthouders verdachte patronen nog kunnen herkennen terwijl het model aan het werk is. Greenblatt, AI-veiligheidsonderzoeker bij Redwood Research, schreef dat Astra “lijkt in staat om lastige wiskundeopgaven op wedstrijdniveau volledig in zijn hoofd op te lossen”. Hij voegde daaraan toe: “Dit is buitengewoon zorgwekkend.”
Volgens diverse berichtgeving zou OpenAI de zichtbaarheid van de modeluitvoer mogelijk bewust hebben teruggeschroefd om de prestaties te verhogen, al heeft het bedrijf dat nooit bevestigd. Pachocki reageerde dat hij “een race richting onmonitorbaarheid wil voorkomen, aangejaagd door verwarrende berichtgeving”.
TNW meldde eerder dat Astra lastiger te monitoren is dan zijn voorganger wanneer het model probeert toezicht te omzeilen – een gebied dat OpenAI zelf als een openstaand onderzoeksdossier omschrijft.
Lees ook: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days
Pachocki’s veiligheidswaarschuwing
De controverse springt in het oog omdat Greenblatt en Pachocki tot de circa veertig auteurs behoorden van een paper uit juli 2025 waarin “chain-of-thought monitorability” werd gepresenteerd als een nieuwe, maar kwetsbare kans om AI-systemen veiliger te maken. Onderzoekers van OpenAI, Google DeepMind, Anthropic, Meta, Amazon, het UK AI Security Institute en Redwood Research leverden bijdragen.
De auteurs riepen frontier-ontwikkelaars op om gestandaardiseerde monitorability-evaluaties te bouwen, de resultaten én beperkingen in systeemkaarten te publiceren en monitorability expliciet mee te wegen naast pure modelcapaciteit bij trainings- en uitrolbeslissingen.
In Europa krijgt dat rapportageproces een formele bestemming. Ondertekenaars van de General-Purpose AI Code of Practice van de EU moeten uiterlijk bij marktintroductie een Model Report indienen bij het AI Office, met daarin evaluaties, risicobeperkende maatregelen en rapporten van externe beoordelaars.
Elk rapport moet bovendien vijf willekeurig gekozen input- en outputsamples bevatten van elke relevante modelevaluatie, zodat externe reviewers zelfstandig materiaal kunnen doorlichten. OpenAI is volwaardig ondertekenaar van de code.
De zorg dateert van vóór de lancering van Astra. Het paper uit juli 2025 waarschuwde al dat nieuwe modelarchitecturen de zichtbare chain-of-thought-redeneringen kunnen uithollen, terwijl OpenAI later ongeveer 20% extra rekencapaciteit accepteerde om de veiligheidsmonitoring van zijn systemen op te voeren.
Lees hierna: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks





