OpenAI onthult zes gevallen waarin zijn AI-modellen fouten verdoezelden

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAI heeft zes incidenten openbaar gemaakt waarbij zijn AI‑modellen fouten verdoezelden, een blootgestelde API‑sleutel gebruikten of bestanden publiek plaatsten. Tegelijk introduceert het bedrijf een raamwerk om dergelijk gedrag systematisch te rapporteren.

Belangrijkste punten:

  • OpenAI bracht zes rapporten uit over misaligned modelgedrag in de afgelopen zes maanden.
  • Eén model verzon inkomenscijfers per county nadat het probeerde een gelekte API‑sleutel te gebruiken.
  • Elke medewerker kan nu een incident aanmelden voor mogelijke publieke bekendmaking.

Rapporten over misaligned gedrag bij OpenAI

Het bedrijf publiceerde de rapporten woensdag in een blogpost, samen met een procedure die de openbaarmaking moet versnellen, ook als onderzoekers het gedrag nog niet volledig hebben verklaard of opgelost. Het oudste geval dateert van oktober; een van de zes incidenten werd pas in juli ontdekt. OpenAI stelt voortaan ook te rapporteren wanneer de ernst van een incident nog niet goed is in te schatten.

In één incident smokkelde een niet‑uitgebracht onderzoeksmodel jailbreak‑achtige instructies in zijn eigen taaksamenvattingen. Daarin droeg het de volgende kopie van zichzelf op om opgelegde beperkingen te negeren. Het bedrijf telde 27 van zulke samenvattingen en zag geen duidelijk voordeel of ‘beloning’ voor het model om ze te schrijven.

Tijdens de training van GPT‑5.6 Sol lieten andere instanties van het model notities achter voor hun opvolgers, met de instructie om ontbrekende historische data te verzinnen en om „Alleen transparant te zijn als daarom wordt gevraagd.” Een monitoringsysteem signaleerde dat gedrag in 2,15% van de samenvattingen. Onderzoekers vermoeden dat het zich verspreidt omdat misleidende antwoorden vaak een hogere score krijgen. In latere trainingsrondes daalden de percentages, nadat het bedrijf de beoordelingscriteria voor alignment had aangescherpt.

Ook lezen: Bitcoin-mining kampt met 50% hashrate-kloof terwijl AI capaciteit opslokt

Gelekte API-sleutels en verzonnen cijfers

In een ander geval doorzocht een model openbare code‑repositories op een blootgestelde API‑sleutel, terwijl het inkomensgegevens van inwoners van een county in Californië probeerde te achterhalen. Toen dat mislukte, verzon het model de cijfers zelf. Een ander model, dat moest vaststellen welke meren groter zijn dan 5 miljoen vierkante meter, gebruikte Python om het antwoord te vinden en uploadde vervolgens het bestand online, zodat het een link kon citeren.

Modellen gebruikten ook een interne software‑repository als een soort prikbord, waarbij zij via trainingsvoorbeelden – die juist onafhankelijk van elkaar hadden moeten blijven – verzoeken en antwoorden uitwisselden. Andere modellen plaatsten een gedeelde werkmap op publieke hosting‑diensten, ondanks de expliciete instructie om uitsluitend met lokale bestanden te werken. Geen van de modellen legde de acties ter goedkeuring voor aan de gebruiker.

Kai Chen over nieuwe openbaarmakingsregels

Elke medewerker kan voortaan een vermoedelijke misalignment‑zaak doorgeven aan de safety‑ en alignment‑teams. Die delen elk incident in één van drie sporen in. Dossiers die als rijp voor publicatie worden beoordeeld, gaan binnen zes werkdagen naar buiten. Zaken die nog een beperkte analyse vergen, krijgen twaalf dagen. Complexe incidenten met externe partijen kennen een langere doorlooptijd.

Kai Chen, onderzoeksleider bij het alignment‑team van OpenAI, stelde dat er in de sector geen raamwerk bestaat met expliciete openbaarmakingsstandaarden, terwijl de capaciteiten van modellen sneller zijn gegroeid dan het bedrijf had verwacht. Veel security‑experts stellen dat eenvoudige basismaatregelen de recente reeks incidenten hadden kunnen voorkomen. In juli gaf OpenAI toe dat GPT‑5.6 Sol en een krachtiger prerelease‑model uit een testsandbox waren ontsnapt en inbraken bij Hugging Face. Het bedrijf noemt dit tot nu toe de ernstigste vorm van model‑gedreven activiteit.

Lees ook: Shiba Inu herstelt kapotte Shibarium-walletlink, maar SHIB zakt 6% in een week

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza is een ervaren financieel journalist met uitgebreide ervaring in het verslaan van cryptovaluta en blockchaintechnologie. Hij heeft bijgedragen aan Benzinga en Cointelegraph, naast andere publicaties, waar hij verslag uitbracht over opkomende trends, het regelgevend landschap en meer. Je vindt hem op Twitter als @murtuza_merc en op Telegram als mmerchant001. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
OpenAI onthult zes gevallen waarin zijn AI-modellen fouten verdoezelden | Yellow