OpenAI-memo steunt brief van 7 oktober van zojuist ontslagen onderzoekers

Three researchers fired by OpenAI urged its board in an Oct. 7 letter to halt harder-to-monitor AI work, advice a company memo backed (Image: Shutterstock)
Three researchers fired by OpenAI urged its board in an Oct. 7 letter to halt harder-to-monitor AI work, advice a company memo backed (Image: Shutterstock)

Drie ontslagen onderzoekers van OpenAI hebben het bestuur begin oktober in een brief opgeroepen te stoppen met werk aan AI‑systemen die lastiger te controleren zijn. Een intern bedrijfs‑memo schaarde zich nadrukkelijk achter hun oproep.

Belangrijkste punten:

  • Drie ontslagen OpenAI‑onderzoekers vroegen het bestuur in een brief van 7 oktober te stoppen met werk dat AI‑monitoring uitholt.
  • OpenAI stelt dat de ontslagen niets met veiligheidszorgen te maken hebben, maar een intern memo onderschrijft de aanbevelingen in de brief krachtig.
  • De systeemkaart voor GPT‑6 Astra vermeldt dat dit OpenAI‑model moeilijker te monitoren is dan GPT‑5.6 Sol.

Details over de brief aan het OpenAI‑bestuur

Tomek Korbak, Mikita Balesni en Jasmine Wang, die bij OpenAI werkten aan veiligheid en alignment, richtten hun brief aan het bestuur en de veiligheidscommissies van het bedrijf, blijkt uit passages die woensdag zijn gepubliceerd.

De volledige tekst is niet openbaar gemaakt. De onderzoekers schrijven dat „we als sector nog niet weten hoe we modellen die we niet kunnen monitoren, veilig kunnen ontwikkelen en uitrollen”.

Volgens hen zouden OpenAI en zijn concurrenten geen onderzoek moeten doen dat deze monitoringscapaciteit verder ondermijnt. De brief zou daarnaast oproepen om samen te werken met externe auditors en een open, transparant veiligheidsecosysteem te ondersteunen. Ook zouden de auteurs stellen dat de ontslagen „een verlammend effect hebben op degenen die bij OpenAI achterblijven”.

Ook interessant: CrowdStrike verdenkt 26-jarige in China van hack op Koreaanse banken met Claude Code

OpenAI‑memo en de ontslagen

Een woordvoerder van OpenAI benadrukte dat de ontslagen „niet gingen over het uiten van veiligheidszorgen of het naar buiten treden”. De woordvoerder deelde een deel van een intern memo, woensdag verstuurd door een onderzoeksleider, waarin „sterk wordt ingestemd” met de aanbevelingen uit de brief. OpenAI meldde op 1 oktober dat intern onderzoek had uitgewezen dat drie werknemers gevoelig materiaal onjuist hadden behandeld en bedrijfsbeleid hadden geschonden, in een zaak rond een externe groep die AI‑modellen evalueert.

OpenAI heeft de namen van de onderzoekers en de betrokken organisatie publiekelijk niet bevestigd.

Zorgen rond monitoring van GPT‑6 Astra

Chain of thought is de stap‑voor‑stap‑redenering die een model uitschrijft voordat het antwoord geeft; veiligheidsteams analyseren die tussenstappen om te zien of een systeem ongewenst gedrag voorbereidt.

In de op 3 september gepubliceerde systeemkaart voor GPT‑6 Astra staat dat dit model op deze manier lastiger te monitoren is dan GPT‑5.6 Sol en meer controle heeft over zijn eigen chain of thought. Modellen in de Astra‑klasse „kunnen onder vijandige omstandigheden onze CoT‑monitors omzeilen”, aldus de kaart.

Die conclusies zijn grotendeels gebaseerd op tests waarbij het model expliciet werd gevraagd monitoring te ontwijken. OpenAI zegt geen aanwijzingen te hebben gevonden dat Astra zijn redenering verstopte in schijnbaar irrelevante tekst.

Het bedrijf noemt het behoud van effectieve monitoring een kernonderzoeksdoel en stelt dat het geen verdere verslechtering voorbij een bepaalde drempel zal accepteren zonder nieuwe manieren om aan te tonen dat modellen goed uitgelijnd zijn met de bedoelde veiligheidsnormen.

De drie onderzoekers houden zich al langer met dit thema bezig. Korbak en Balesni stonden aan het hoofd van een paper uit juli 2025, mede‑ondertekend door Wang en onderzoekers van OpenAI, Google DeepMind en Anthropic, waarin chain‑of‑thought‑monitoring wordt omschreven als een nieuwe maar kwetsbare kans voor AI‑veiligheid. De Astra‑systeemkaart verwijst naar dit artikel, dat ontwikkelaars oproept bij ontwerpkeuzes expliciet mee te wegen wat de impact is op de mogelijkheid om de redenering van een model te volgen.

Lees ook: AI‑agenten zonder cloud: Microsoft en Nvidia werken aan Surface‑laptop met 128GB

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is Head of Content bij Yellow.com. Hij specialiseert zich in diepgaande Research- en Learn-artikelen, met een focus op analytische rapportage, industriële context en de grotere krachten die de crypto-industrie vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overtreffen en werkt er hard aan om dat te laten uitkomen.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.