Qwen3.8-Max versus GPT-5.6: Chinees 2,4-biljoenparameter-model daagt OpenAI-topmodel uit

Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)
Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)

Alibaba's Qwen3.8-Max met 2,4 biljoen parameters is deze week gelanceerd, precies op het moment dat Chinese AI-systemen tot 46% van het Amerikaanse ondernemingsverkeer in tokens voor hun rekening nemen en zo OpenAI's GPT-5.6 onder toenemende druk zetten.

Belangrijkste punten:

  • Alibaba’s Qwen3.8-Max telt in totaal 2,4 biljoen parameters en activeert 95 miljard parameters per verzoek; open gewichten worden volgende week verwacht.
  • GPT-5.6 Sol blijft op het door Alibaba gepubliceerde agentische codebenchmark de koploper, maar de verschillen zijn klein en nog niet extern gevalideerd.
  • OpenAI verlaagde op 30 juli zijn goedkoopste prijstier met 80%, drie weken na de lancering, terwijl Chinese modellen steeds meer volume naar zich toetrekken.

Qwen3.8-Max-benchmarks zetten druk op GPT-5.6 Sol

Alibaba presenteerde het model op 3 augustus. Het gaat om een mixture-of-experts-architectuur met in totaal 2,4 biljoen parameters, waarvan per individuele aanvraag slechts 95 miljard worden geactiveerd.

Het concern kondigde aan dat de open gewichten van het vlaggenschip en een kleinere variant met 27 miljard parameters volgende week in openbare repositories worden geplaatst. Daarmee breekt Alibaba met een reeks gesloten releases in zijn topsegment. Het bedrijf publiceerde ook een volledige benchmarktabel.

Volgens die cijfers behaalt Qwen3.8-Max een score van 86,6 op Terminal-Bench 2.1, een test voor agentisch programmeren waarop OpenAI’s GPT-5.6 Sol met 88,8 nog altijd de hoogste score heeft. Op SWE-bench Pro haalt Qwen3.8-Max 67,7 tegenover 80,0 voor Anthropic’s Claude Fable 5. Op OSWorld-Verified, een benchmark voor computergebruik, claimt het model 86,1 punten tegenover 83,2 voor Sol.

Geen enkel onafhankelijk laboratorium heeft deze resultaten tot nu toe gerepliceerd. Alibaba stelt dat het model zestien dagen lang zonder menselijke tussenkomst een commandline-tool ontwikkelde, die binnenkomende gebruikersverzoeken omzet in werkende code en vervolgens zelf test. Ontwikkelaars zetten vraagtekens bij zowel de demonstratie als de licentievoorwaarden.

Ook interessant: iPhone 18 Pro Max kan eerste toestel worden met Apple’s 2nm-chip, 15% sneller

Ion Stoica over kleinere Chinese achterstand

Ion Stoica, computerwetenschapper aan de University of California, Berkeley en mede-oprichter van benchmarkplatform Arena, schatte eind juli dat Chinese open-weight-modellen de Amerikaanse frontierlabs nog slechts twee à drie maanden achterlopen. Eerder ging hij uit van een achterstand van zes tot negen maanden. Die verschuiving valt samen met een jaar aan open releases van onder anderen DeepSeek en de GLM-lijn van Z.ai.

“Prijs is hier de drijvende kracht,” zegt Harpreet Arora, verantwoordelijk voor agentische infrastructuur bij Vercel. Hij beschrijft engineeringteams die standaardwerk simpelweg routeren naar het goedkoopste model dat nog net aan de kwaliteitslat voldoet. Justin Summerville van OpenRouter berekende dat open Chinese modellen 60% tot 90% goedkoper zijn. De routeringsbeslissing volgt daarmee puur de rekensom.

GPT-5.6-prijzen moeten volumemarkt verdedigen

OpenAI verlaagde zijn Luna-tarief op 30 juli met 80%, tot 20 cent per miljoen inputtokens en $1,20 per miljoen outputtokens, amper drie weken na de lancering van de GPT-5.6-familie. Het Terra-tarief ging 20% omlaag, terwijl vlaggenschip Sol op $5 en $30 per miljoen tokens bleef staan.

Deze prijsstructuur houdt de premiumpositionering van het topmodel in stand, terwijl de lagere segmenten een prijzenoorlog voeren om het volume dat Chinese labs dit jaar gestaag naar zich toe trekken.

Modellen van Chinese makelij steigeren van 4,5% van het Amerikaanse tokenvolume op een groot routeringsplatform in de eerste helft van 2025 naar ruim 30% per week sinds februari, met een piek op 46%. Onderzoekers van de Stanford University registreerden in maart dat het beste Amerikaanse model nog slechts 2,7 procentpunt voorsprong had op de benchmarks, tegenover maximaal 31,6 procentpunt in 2023.

Lees ook: Bitcoin kan extreme angst omzetten in brandstof voor een rally naar $75.000

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is de Head of Content bij Yellow.com en doet al 10 jaar verslag van crypto. Hij is gespecialiseerd in diepgaande Research- en Learn-artikelen, met een focus op analytische berichtgeving, sectorcontext en de grote krachten die de cryptowereld vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overstijgen en werkt er hard aan om dat werkelijkheid te laten worden.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.