Drie ontslagen onderzoekers van OpenAI hebben het bestuur begin oktober in een brief opgeroepen te stoppen met werk aan AI‑systemen die lastiger te controleren zijn. Een intern bedrijfs‑memo schaarde zich nadrukkelijk achter hun oproep.
Belangrijkste punten:
- Drie ontslagen OpenAI‑onderzoekers vroegen het bestuur in een brief van 7 oktober te stoppen met werk dat AI‑monitoring uitholt.
- OpenAI stelt dat de ontslagen niets met veiligheidszorgen te maken hebben, maar een intern memo onderschrijft de aanbevelingen in de brief krachtig.
- De systeemkaart voor GPT‑6 Astra vermeldt dat dit OpenAI‑model moeilijker te monitoren is dan GPT‑5.6 Sol.
Details over de brief aan het OpenAI‑bestuur
Tomek Korbak, Mikita Balesni en Jasmine Wang, die bij OpenAI werkten aan veiligheid en alignment, richtten hun brief aan het bestuur en de veiligheidscommissies van het bedrijf, blijkt uit passages die woensdag zijn gepubliceerd.
De volledige tekst is niet openbaar gemaakt. De onderzoekers schrijven dat „we als sector nog niet weten hoe we modellen die we niet kunnen monitoren, veilig kunnen ontwikkelen en uitrollen”.
Volgens hen zouden OpenAI en zijn concurrenten geen onderzoek moeten doen dat deze monitoringscapaciteit verder ondermijnt. De brief zou daarnaast oproepen om samen te werken met externe auditors en een open, transparant veiligheidsecosysteem te ondersteunen. Ook zouden de auteurs stellen dat de ontslagen „een verlammend effect hebben op degenen die bij OpenAI achterblijven”.
Ook interessant: CrowdStrike verdenkt 26-jarige in China van hack op Koreaanse banken met Claude Code
OpenAI‑memo en de ontslagen
Een woordvoerder van OpenAI benadrukte dat de ontslagen „niet gingen over het uiten van veiligheidszorgen of het naar buiten treden”. De woordvoerder deelde een deel van een intern memo, woensdag verstuurd door een onderzoeksleider, waarin „sterk wordt ingestemd” met de aanbevelingen uit de brief. OpenAI meldde op 1 oktober dat intern onderzoek had uitgewezen dat drie werknemers gevoelig materiaal onjuist hadden behandeld en bedrijfsbeleid hadden geschonden, in een zaak rond een externe groep die AI‑modellen evalueert.
OpenAI heeft de namen van de onderzoekers en de betrokken organisatie publiekelijk niet bevestigd.
Zorgen rond monitoring van GPT‑6 Astra
Chain of thought is de stap‑voor‑stap‑redenering die een model uitschrijft voordat het antwoord geeft; veiligheidsteams analyseren die tussenstappen om te zien of een systeem ongewenst gedrag voorbereidt.
In de op 3 september gepubliceerde systeemkaart voor GPT‑6 Astra staat dat dit model op deze manier lastiger te monitoren is dan GPT‑5.6 Sol en meer controle heeft over zijn eigen chain of thought. Modellen in de Astra‑klasse „kunnen onder vijandige omstandigheden onze CoT‑monitors omzeilen”, aldus de kaart.
Die conclusies zijn grotendeels gebaseerd op tests waarbij het model expliciet werd gevraagd monitoring te ontwijken. OpenAI zegt geen aanwijzingen te hebben gevonden dat Astra zijn redenering verstopte in schijnbaar irrelevante tekst.
Het bedrijf noemt het behoud van effectieve monitoring een kernonderzoeksdoel en stelt dat het geen verdere verslechtering voorbij een bepaalde drempel zal accepteren zonder nieuwe manieren om aan te tonen dat modellen goed uitgelijnd zijn met de bedoelde veiligheidsnormen.
De drie onderzoekers houden zich al langer met dit thema bezig. Korbak en Balesni stonden aan het hoofd van een paper uit juli 2025, mede‑ondertekend door Wang en onderzoekers van OpenAI, Google DeepMind en Anthropic, waarin chain‑of‑thought‑monitoring wordt omschreven als een nieuwe maar kwetsbare kans voor AI‑veiligheid. De Astra‑systeemkaart verwijst naar dit artikel, dat ontwikkelaars oproept bij ontwerpkeuzes expliciet mee te wegen wat de impact is op de mogelijkheid om de redenering van een model te volgen.
Lees ook: AI‑agenten zonder cloud: Microsoft en Nvidia werken aan Surface‑laptop met 128GB

