Qwen3.8-Max od Alibaba z 2,4 bln parametrów zadebiutował w tym tygodniu, dokładnie w momencie, gdy chińskie systemy odpowiadają już za nawet 46% ruchu tokenów generowanych przez amerykańskie przedsiębiorstwa – mocno ograniczając udział GPT-5.6 od OpenAI.
Najważniejsze informacje:
- Qwen3.8-Max ma łącznie 2,4 bln parametrów, z których przy pojedynczym wywołaniu aktywowanych jest 95 mld; otwarte wagi mają się pojawić w przyszłym tygodniu.
- GPT-5.6 Sol wciąż prowadzi w zaprezentowanym przez Alibaba benchmarku agentowego kodowania, ale różnice są niewielkie i niepotwierdzone przez niezależne laboratoria.
- OpenAI 30 lipca obniżył ceny najtańszego progu aż o 80%, trzy tygodnie po starcie GPT-5.6, gdy chińskie modele zaczęły przejmować wolumen.
Qwen3.8-Max na celowniku benchmarków kontra GPT-5.6 Sol
Alibaba zaprezentował Qwen3.8-Max 3 sierpnia. To system typu mixture-of-experts z łączną liczbą 2,4 bln parametrów, z czego przy jednym zapytaniu wykorzystywane jest jedynie 95 mld.
Firma zapowiedziała, że w przyszłym tygodniu udostępni otwarte wagi dla flagowego modelu oraz mniejszej, 27‑miliardowej wersji – odwracając trend zamkniętych wydań w swojej topowej linii modeli. Alibaba upublicznił też pełną tabelę wyników w benchmarkach.
Według tych danych Qwen3.8-Max osiąga 86,6 punktu w Terminal-Bench 2.1, teście agentowego programowania, w którym GPT-5.6 Sol od OpenAI pozostaje liderem z wynikiem 88,8. W SWE-bench Pro model Alibaba uzyskał 67,7 wobec 80,0 dla Claude Fable 5 od Anthropic, natomiast w OSWorld-Verified, teście użytkowania komputera, Qwen3.8-Max zadeklarował 86,1 punktu, przy 83,2 dla Sol.
Wyników nie potwierdziło jak dotąd żadne niezależne laboratorium. Alibaba przekonuje, że model przez 16 dni samodzielnie budował narzędzie wiersza poleceń – bez ingerencji człowieka – zamieniając napływające żądania użytkowników na działający kod i samodzielnie go testując. Część deweloperów zakwestionowała zarówno tę demonstrację, jak i warunki licencyjne.
Warto przeczytać: iPhone 18 Pro Max może być pierwszym z 2-nanometrowym układem Apple, szybszym o 15%
Ion Stoica: dystans Chin do USA szybko się kurczy
Ion Stoica, informatyk z University of California w Berkeley i współtwórca platformy benchmarkowej Arena, ocenił pod koniec lipca, że chińskie modele z otwartymi wagami są dziś opóźnione względem amerykańskich „frontier labs” już tylko o dwa–trzy miesiące. Wcześniej mówił o sześciu–dziewięciu miesiącach, a to przesunięcie pokrywa się z rokiem intensywnych, otwartych wydań od DeepSeek i linii GLM firmy Z.ai.
– Tu pracuje przede wszystkim cena – komentuje Harpreet Arora, odpowiedzialny za infrastrukturę agentów w Vercel, opisując zespoły inżynieryjne, które kierują rutynowe zadania do najtańszego modelu spełniającego wymagany próg jakości. Justin Summerville z OpenRouter oszacował, że otwarte chińskie systemy są od 60% do 90% tańsze. Algorytmy routingu po prostu podążają za matematyką.
Cennik GPT-5.6 w obronie wolumenu
OpenAI obniżył 30 lipca ceny warstwy Luna o 80%, do 0,20 dol. za milion tokenów wejściowych i 1,20 dol. za milion tokenów wyjściowych – zaledwie trzy tygodnie po starcie rodziny GPT-5.6. Warstwa Terra potaniała o 20%, podczas gdy flagowy Sol utrzymał stawkę 5 dol. za milion tokenów wejściowych i 30 dol. za milion wyjściowych.
Taka struktura cenowa pozwala utrzymać solidną premię na szczycie oferty, a jednocześnie wysyła niższe progi do walki o wolumen, który przez cały rok sukcesywnie przejmują chińskie laboratoria.
Modele pochodzenia chińskiego wzrosły z 4,5% udziału w wolumenie tokenów w USA na jednej z dużych platform routingu w pierwszej połowie 2025 r. do ponad 30% tygodniowo od lutego, z maksimum na poziomie 46%. Naukowcy ze Stanford University zarejestrowali, że w marcu przewaga najlepszych amerykańskich modeli w benchmarkach stopniała do 2,7 punktu proc., wobec nawet 31,6 pkt proc. w 2023 r.
Przeczytaj też: Bitcoin może zmienić skrajny strach w paliwo dla rajdu do 75 tys. dol.






