OpenAI Chief Research Officer Mark Chen zei dat het bedrijf dicht bij AI-modellen is die hun eigen onderzoek kunnen uitvoeren, waardoor artificiële algemene intelligentie steeds meer binnen bereik komt.
Belangrijkste punten:
- Chen stelde dat scaling laws nog steeds gelden, waarbij pretraining en langere redeneerketens de vooruitgang richting AGI blijven aandrijven.
- Hij zei dat modellen die in staat zijn tot zelfvoorzienend onderzoek dichtbij zijn, een verschuiving die de rol van menselijke onderzoekers zou hertekenen.
- Chen noemde een toenemende evaluatiecrisis en onopgelost continu leren als de grootste obstakels voor het veld.
Chen schetst het pad naar AGI
Chen lichtte zijn visie toe in een recent podcastinterview, waarin hij op camera kookte terwijl hij de onderzoeksstrategie van OpenAI uitlegde.
Hij weerlegde de stelling dat schaalvergroting is vastgelopen. Dat argument duikt volgens hem telkens weer op wanneer het veld een nieuwe bottleneck raakt.
Het bedrijf bevindt zich op een exponentiële curve die standhoudt over bijna 10 ordes van grootte, en weinig wijst erop dat die zal doorbreken, zo beweerde hij.
Chen wees ook op de gok van OpenAI op redeneren. Hij zei dat vroege sceptici binnen het bedrijf vraagtekens zetten bij het o1-project voordat Jakub Pachocki, Ilya Sutskever en een paar anderen het vooruit duwden.
Nu verwacht hij dat modellen onderzoekstaken op zich nemen die zich over weken uitstrekken en ideeën opleveren die voorbij de blinde vlekken van menselijke experts gaan.
De roadmap van OpenAI beslaat drie jaar, gaf hij aan, en eindigt met modellen die onderzoek van begin tot eind afhandelen, van het eerste idee tot het eindresultaat.
Ook lezen: BitMine trotseert de sell-off met een Ethereum-weddenschap van $43M, strategie knippert
Waarom het idee van de vibe-onderzoeker ertoe doet
Chen introduceerde een term die aandacht trok: de vibe-onderzoeker.
In die toekomst, vertelde hij luisteraars, stoppen de beste onderzoekers met het schrijven van elke regel code en sturen ze in plaats daarvan modellen aan die uitvoering en planning overnemen. Menselijk werk vernauwt zich tot twee taken: scherpe vragen stellen en beoordelen of een antwoord echt smaak heeft.
Dat toekomstbeeld staat op wankele grond, en Chen doet niet alsof dat niet zo is.
Hij waarschuwde voor een evaluatiecrisis, en beschreef teams die jagen op benchmark-scores zonder echte vooruitgang, een gewoonte die hij benchmaxxing noemt. Oudere tests zijn nu verzadigd, en nieuwe verliezen hun waarde bijna zodra ze openbaar worden.
Continu leren blijft de lastigere kloof. Chen noemde het een basisvaardigheid die het veld nog moet ontgrendelen, ook al zei hij dat veel inspanningen het probleem al aanpakken.
Als die boog standhoudt, suggereerde Chen, verschuift de schaarsste menselijke hulpbron van ruwe intelligentie naar oordeel en geleefde ervaring.
Chen heeft deze zaak eerder in varianten bepleit. Rond de lancering van GPT-4.5 betoogde hij dat het scaling-paradigma kan doorgaan, en hij heeft al lang volgehouden dat er geen bewijs is dat scaling laws dood zijn.
Lees hierna: CZ zegt dat Binance dagen verwijderd was van MiCA-goedkeuring voordat de politiek toesloeg





