Qwen3.8-Max face à GPT-5.6 : la riposte à 2,4 billions de paramètres au modèle vedette d’OpenAI

Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)
Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)

Alibaba et son modèle Qwen3.8-Max à 2,4 billions de paramètres débarquent cette semaine, au moment où les systèmes chinois revendiquent jusqu’à 46 % du trafic de jetons des entreprises américaines, grignotant les parts de marché de GPT-5.6 d’OpenAI.

Points clés :

  • Qwen3.8-Max d’Alibaba aligne 2,4 billions de paramètres au total et en active 95 milliards par requête. Des poids ouverts sont annoncés pour la semaine prochaine.
  • GPT-5.6 Sol reste en tête du benchmark de programmation agentique publié par Alibaba, mais l’écart est mince et non validé par des laboratoires indépendants.
  • OpenAI a réduit de 80 % le prix de son palier d’entrée le 30 juillet, trois semaines après le lancement, alors que les modèles chinois s’emparent des volumes.

Qwen3.8-Max se mesure à GPT-5.6 Sol sur les benchmarks

Alibaba a dévoilé Qwen3.8-Max le 3 août. Il s’agit d’un système « mixture-of-experts » qui totalise 2,4 billions de paramètres, mais n’en active que 95 milliards pour chaque requête.

Le groupe indique que les poids ouverts de ce modèle phare, ainsi que d’une version allégée de 27 milliards de paramètres, seront publiés dans des dépôts publics la semaine prochaine, rompant avec la série de sorties fermées de sa gamme haut de gamme. Alibaba a également mis en ligne un tableau de benchmarks complet.

Selon ces chiffres, Qwen3.8-Max obtient 86,6 sur Terminal-Bench 2.1, un test de programmation agentique où GPT-5.6 Sol d’OpenAI domine encore avec 88,8. Sur SWE-bench Pro, il atteint 67,7, contre 80,0 pour Claude Fable 5 d’Anthropic. Sur OSWorld-Verified, un benchmark d’usage autonome de l’ordinateur, Qwen3.8-Max revendique 86,1, contre 83,2 pour Sol.

Aucun laboratoire indépendant n’a, pour l’heure, reproduit ces résultats. Alibaba affirme que le modèle a passé 16 jours à développer un outil en ligne de commande sans intervention humaine, en transformant les requêtes utilisateurs en code opérationnel et en exécutant ses propres tests. Des développeurs ont mis en doute la démonstration ainsi que les conditions de licence.

À lire aussi : iPhone 18 Pro Max pourrait être le premier équipé d’une puce 2 nm d’Apple, 15 % plus rapide

Ion Stoica mesure le resserrement de l’écart avec la Chine

Ion Stoica, informaticien à l’Université de Californie, Berkeley et cofondateur de la plateforme de benchmark Arena, estime, dans une analyse publiée fin juillet, que les modèles chinois à poids ouverts n’accusent plus qu’un retard de deux à trois mois sur les laboratoires américains de pointe. Il évaluait précédemment ce décalage entre six et neuf mois, une réduction qui suit une année de publications ouvertes de DeepSeek et de la gamme GLM de Z.ai.

« Le prix fait la différence », résume Harpreet Arora, en charge des infrastructures agentiques chez Vercel, décrivant des équipes d’ingénierie qui orientent les tâches courantes vers le modèle le moins cher répondant au cahier des charges. Justin Summerville d’OpenRouter a mesuré un avantage tarifaire compris entre 60 % et 90 % pour les systèmes chinois ouverts. Le routage suit tout simplement l’arithmétique.

Les prix de GPT-5.6 pour défendre les volumes

OpenAI a abaissé de 80 % le tarif de son palier Luna le 30 juillet, trois semaines après le lancement de la famille GPT-5.6, à 0,20 dollar pour un million de jetons en entrée et 1,20 dollar pour un million de jetons en sortie. Terra a reculé de 20 %, tandis que le modèle vedette Sol reste à 5 dollars en entrée et 30 dollars en sortie.

Cette structure maintient un prix de prestige au sommet de la gamme, tandis que les paliers intermédiaires se livrent bataille sur les volumes que les laboratoires chinois captent depuis le début de l’année.

Les modèles d’origine chinoise ont grimpé de 4,5 % du volume de jetons américains sur une grande plateforme de routage au premier semestre 2025 à plus de 30 % chaque semaine depuis février, avec un pic à 46 %. Des chercheurs de l’Université Stanford ont mesuré en mars un avantage de performance moyen de seulement 2,7 points de pourcentage pour le meilleur modèle américain, contre jusqu’à 31,6 points en 2023.

À suivre : Le Bitcoin pourrait transformer une peur extrême en carburant pour un rallye vers 75 000 $

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est responsable du contenu chez Yellow.com et couvre l’actualité crypto depuis dix ans. Il est spécialisé dans les articles de Recherche et Learn approfondis, avec un accent particulier sur l’analyse, la mise en contexte sectorielle et les grandes forces qui façonnent l’écosystème crypto, de l’ère de l’IA et des technologies de sécurité aux innovations fintech. Il est convaincu que tout ce qui est numérique supplantera très prochainement tout ce qui est analogique et travaille dur pour contribuer à rendre cela possible.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.