OpenAI’s Astra lijkt aanzienlijk minder zichtbare redeneringen te tonen. Dat wakkert opnieuw zorgen aan die in een monitorability-paper uit 2025 werden geschetst door onder meer chief scientist Jakub Pachocki.
Belangrijkste punten:
- Astra laat minder van zijn redeneringen in tekst zien, waardoor twijfels ontstaan of toezichthouders problematisch gedrag nog tijdig kunnen opmerken.
- Ryan Greenblatt en Pachocki waren in juli 2025 mede‑auteur van een paper die de monitorbaarheid van chain‑of‑thought als een kwetsbare kans voor AI‑veiligheid bestempelde.
- Ondertekenaars van de EU‑gedragscode voor generieke AI‑systemen moeten bij het AI Office modelveiligheidsrapporten indienen, inclusief evaluatie‑evidence voor onafhankelijk toezicht.
Monitorbaarheid van Astra
Semafor meldde dat Astra meer redenering intern lijkt uit te voeren, zonder die als zichtbare tekst prijs te geven. Dat roept de vraag op of toezichthouders nog voldoende signalen zien om verdacht gedrag te herkennen terwijl het model werkt. Greenblatt, AI‑veiligheidsonderzoeker bij Redwood Research, schreef dat Astra „lijkt alsof het moeilijke wiskunde‑competitieproblemen volledig in zijn hoofd kan oplossen”. Volgens hem is dat „uiterst zorgwekkend”.
Diverse berichten suggereren dat OpenAI de zichtbaarheid van de modeluitvoer bewust heeft teruggeschroefd om de prestaties te verbeteren, al heeft het bedrijf dat niet bevestigd. Pachocki reageerde dat hij „een race richting onmonitorbaarheid wil voorkomen die wordt aangejaagd door verwarrende berichtgeving”.
TNW berichtte eerder dat Astra lastiger te monitoren werd dan zijn voorganger zodra het model actief probeerde toezicht te ontwijken – een domein dat OpenAI zelf als een openstaande onderzoeksprioriteit omschrijft.
Ook interessant: OpenAI zegt dat AI nu onderzoekstaken van meerdere dagen aankan
Veiligheidswaarschuwing van Pachocki
De controverse is opmerkelijk omdat Greenblatt en Pachocki tot de circa 40 auteurs behoorden van een paper uit juli 2025, waarin de monitorbaarheid van chain‑of‑thought werd beschreven als een nieuwe, maar kwetsbare kans voor AI‑veiligheid. Onderzoekers van OpenAI, Google DeepMind, Anthropic, Meta, Amazon, het UK AI Security Institute en Redwood Research leverden bijdragen.
De auteurs riepen toonaangevende ontwikkelaars op om gestandaardiseerde monitorability‑evaluaties te ontwikkelen, de resultaten en beperkingen transparant vast te leggen in system cards en monitorbaarheid expliciet mee te wegen naast pure capaciteit bij beslissingen over training en uitrol.
In Europa krijgt dat rapportageproces een formeel loket. Ondertekenaars van de General‑Purpose AI Code of Practice van de EU moeten vóór marktintroductie een Model Report indienen bij het AI Office, met daarin de uitgevoerde evaluaties, getroffen mitigaties en rapporten van externe beoordelaars.
Elk rapport moet bovendien vijf willekeurig geselecteerde input‑ en outputvoorbeelden bevatten uit iedere relevante modelevaluatie. Zo krijgen externe reviewers concreet materiaal voor een onafhankelijke beoordeling, en OpenAI is een volwaardige ondertekenaar van de code.
De zorg gaat verder terug dan de lancering van Astra. Het paper uit juli 2025 waarschuwde dat nieuwe modelarchitecturen de zichtbare chain‑of‑thought‑redeneringen kunnen verzwakken. OpenAI accepteerde later een extra rekenlast van ongeveer 20% om uitgebreidere veiligheidsmonitoring van zijn systemen mogelijk te maken.
Lees verder: Bitcoin-ETF’s halen $987 mln op en verlengen instroomreeks tot drie weken

