OpenAI’s Astra verbergt meer redeneringen en blaast veiligheidswaarschuwing uit 2025 nieuw leven in

Alexey Bondarev
Alexey Bondarev51 minuten geleden
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

OpenAI’s Astra lijkt minder van zijn redeneringen expliciet in tekst te tonen. Dat wakkert opnieuw de zorgen aan uit een monitorability-paper uit 2025, mede geschreven door chief scientist Jakub Pachocki.

Belangrijkste punten:

  • Astra lijkt een groter deel van zijn redeneerwerk intern af te handelen, wat vragen oproept of toezichthouders problematisch gedrag nog tijdig kunnen signaleren.
  • Ryan Greenblatt en Pachocki schreven in juli 2025 mee aan een paper die concludeerde dat “chain-of-thought monitorability” een kwetsbare maar cruciale kans voor AI-veiligheid is.
  • Ondertekenaars van de EU-gedragscode voor algemene AI-systemen moeten modelveiligheidsrapporten indienen bij het AI Office, inclusief evaluatiebewijzen voor onafhankelijk toezicht.

Astra en monitorability

Semafor meldde dat Astra meer redeneert zonder die tussenstappen nog in zichtbare tekst vrij te geven. Daardoor rijst de vraag of toezichthouders verdachte patronen nog kunnen herkennen terwijl het model aan het werk is. Greenblatt, AI-veiligheidsonderzoeker bij Redwood Research, schreef dat Astra “lijkt in staat om lastige wiskundeopgaven op wedstrijdniveau volledig in zijn hoofd op te lossen”. Hij voegde daaraan toe: “Dit is buitengewoon zorgwekkend.”

Volgens diverse berichtgeving zou OpenAI de zichtbaarheid van de modeluitvoer mogelijk bewust hebben teruggeschroefd om de prestaties te verhogen, al heeft het bedrijf dat nooit bevestigd. Pachocki reageerde dat hij “een race richting onmonitorbaarheid wil voorkomen, aangejaagd door verwarrende berichtgeving”.

TNW meldde eerder dat Astra lastiger te monitoren is dan zijn voorganger wanneer het model probeert toezicht te omzeilen – een gebied dat OpenAI zelf als een openstaand onderzoeksdossier omschrijft.

Lees ook: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days

Pachocki’s veiligheidswaarschuwing

De controverse springt in het oog omdat Greenblatt en Pachocki tot de circa veertig auteurs behoorden van een paper uit juli 2025 waarin “chain-of-thought monitorability” werd gepresenteerd als een nieuwe, maar kwetsbare kans om AI-systemen veiliger te maken. Onderzoekers van OpenAI, Google DeepMind, Anthropic, Meta, Amazon, het UK AI Security Institute en Redwood Research leverden bijdragen.

De auteurs riepen frontier-ontwikkelaars op om gestandaardiseerde monitorability-evaluaties te bouwen, de resultaten én beperkingen in systeemkaarten te publiceren en monitorability expliciet mee te wegen naast pure modelcapaciteit bij trainings- en uitrolbeslissingen.

In Europa krijgt dat rapportageproces een formele bestemming. Ondertekenaars van de General-Purpose AI Code of Practice van de EU moeten uiterlijk bij marktintroductie een Model Report indienen bij het AI Office, met daarin evaluaties, risicobeperkende maatregelen en rapporten van externe beoordelaars.

Elk rapport moet bovendien vijf willekeurig gekozen input- en outputsamples bevatten van elke relevante modelevaluatie, zodat externe reviewers zelfstandig materiaal kunnen doorlichten. OpenAI is volwaardig ondertekenaar van de code.

De zorg dateert van vóór de lancering van Astra. Het paper uit juli 2025 waarschuwde al dat nieuwe modelarchitecturen de zichtbare chain-of-thought-redeneringen kunnen uithollen, terwijl OpenAI later ongeveer 20% extra rekencapaciteit accepteerde om de veiligheidsmonitoring van zijn systemen op te voeren.

Lees hierna: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is de Head of Content bij Yellow.com en doet al 10 jaar verslag van crypto. Hij is gespecialiseerd in diepgaande Research- en Learn-artikelen, met een focus op analytische berichtgeving, sectorcontext en de grote krachten die de cryptowereld vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overstijgen en werkt er hard aan om dat werkelijkheid te laten worden.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.