OpenAI’s 719 AI-bewijzen onder vuur: raakte Navier-Stokes zoek in de vertaling?

Doubts over 719 AI math manuscripts from OpenAI grew after a paper said its Navier-Stokes proof and Lean code differ (Image: Shutterstock)
Doubts over 719 AI math manuscripts from OpenAI grew after a paper said its Navier-Stokes proof and Lean code differ (Image: Shutterstock)

Wiskundigen zetten vraagtekens bij de betrouwbaarheid van OpenAI’s 719 door AI gegenereerde wiskundige manuscripten, nadat een nieuw artikel stelde dat het eerder gepresenteerde Navier-Stokes-bewijs niet strookt met de door de computer gecontroleerde versie.

Belangrijkste punten:

  • OpenAI’s catalogus kromp van 722 naar 719 manuscripten nadat het bedrijf drie artikelen introk wegens een tekenfout.
  • Drie in het VK gevestigde wiskundigen beschreven twee plekken waar het geschreven Navier-Stokes-bewijs en de Lean-code uiteenlopen.
  • De auteurs noemen het bewijs niet fout, maar stellen dat machinecontroles peer review niet kunnen vervangen.

Publicatie van OpenAI’s wiskundecollectie

OpenAI zette de verzameling op 6 oktober online. Een donderdag gepubliceerd rapport constateerde dat het project afweek van de richtlijnen die een onafhankelijke commissie van wiskundigen voor AI-labs had opgesteld. De catalogus startte met 722 manuscripten. OpenAI trok er een dag later drie terug, nadat een tekenfout één redenering onderuit haalde en daarmee ook twee papers die daarop voortbouwden.

Die richtlijnen, op 29 september uitgebracht door de negenkoppige Advisory Group on Mathematics and Artificial Intelligence, openen met een oproep aan labs om te stoppen met het testen van geavanceerde wiskundeproblemen op gesloten, propriëtaire modellen. In het OpenAI‑repository staat dat de papers voortkomen uit het testen van een nog niet vrijgegeven intern model op open onderzoeksproblemen.

Samenvattingen van de redeneringen van het model zijn slechts bij tien resultaten beschikbaar, en ongeveer 42% van de hoofdresultaten is geformaliseerd in Lean, een programmeertaal waarmee een computer een bewijs formeel kan verifiëren.

Lees ook: Hoeveel verdient de CEO van Anthropic? IPO-document onthult het antwoord

Hiaten in het Navier-Stokes-bewijs

Alexander Bastounis van King’s College London en Fabian Circelli en Anders Hansen van de University of Cambridge bestudeerden het Navier-Stokes-bewijs dat OpenAI in september aankondigde. Zij legden twee punten vast waarop het geschreven betoog en de Lean-code uit elkaar lopen, waaronder een geval waarin de code slechts een zwakkere schatting aantoont dan in het artikel wordt geclaimd.

De auteurs doen geen uitspraak over de juistheid van het geschreven bewijs als geheel. Hun boodschap is specifieker. Lean bevestigt dat de eindstelling klopt, schrijven zij, maar kan niet aantonen dat alle tussenzettingen die een lezer ziet ook deugen. Zulke bewijzen blijven daarom aangewezen op grondige peer review.

Fieldsmedaillewinnaar Terence Tao schreef op 6 oktober dat problemen worden opgelost door “AI-prompters” die de uitkomsten onvoldoende begrijpen om vragen te beantwoorden of er lezingen over te geven. De Harvard-hoogleraar Melanie Matchett Wood, lid van de adviesgroep, stelde dat bij publicatie feitelijk nog geen enkele mens zulke resultaten goed doorgrondt: „en dan begint het echte werk pas.”

Controverse rond OpenAI-bewijzen

De adviesgroep benadrukt dat alleen de bredere wiskundige gemeenschap kan beoordelen in hoeverre OpenAI haar aanbevelingen daadwerkelijk heeft gevolgd. Die toetsing volgt op een gespannen maand. OpenAI kondigde het Navier-Stokes-resultaat op 8 september aan, wat een creditschermutseling ontketende met de wiskundige Tristan Buckmaster van New York University. Drie dagen later lanceerden 25 Fieldsmedaillewinnaars een verklaring waarin zij waarschuwden dat in massa geproduceerde AI-resultaten het vakgebied kunnen schaden.

Verder lezen: OpenAI’s 722 AI-wiskundepapers zijn openbaar, nu moeten wiskundigen hun oordeel vellen

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is Head of Content bij Yellow.com. Hij specialiseert zich in diepgaande Research- en Learn-artikelen, met een focus op analytische rapportage, industriële context en de grotere krachten die de crypto-industrie vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overtreffen en werkt er hard aan om dat te laten uitkomen.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
OpenAI’s 719 AI-bewijzen onder vuur: raakte Navier-Stokes zoek in de vertaling? | Yellow