Alibaba запустила модель Qwen3.8-Max з 2,4 трлн параметрів саме тоді, коли китайські системи вже забирають до 46% токен-трафіку від корпоративних клієнтів у США, звужуючи простір для OpenAI з його GPT-5.6.
Головне:
- Qwen3.8-Max від Alibaba має загалом 2,4 трлн параметрів, але під час одного запиту активує лише 95 млрд; відкриті ваги обіцяні на наступний тиждень.
- GPT-5.6 Sol все ще очолює опублікований Alibaba агентний бенчмарк з програмування, однак відрив мінімальний і поки не підтверджений незалежними лабораторіями.
- OpenAI 30 липня урізала ціну найдешевшого тарифу на 80% — через три тижні після запуску, на тлі перетікання обсягу до китайських моделей.
Бенчмарки Qwen3.8-Max кинули виклик GPT-5.6 Sol
Alibaba представила Qwen3.8-Max 3 серпня як систему типу mixture-of-experts: у моделі 2,4 трлн параметрів, але в кожному окремому запиті задіюється лише 95 млрд.
Компанія заявила, що відкриті ваги для флагмана та меншої версії на 27 млрд параметрів стануть доступні в публічних репозиторіях вже наступного тижня — це фактичний розворот після низки закритих релізів у топовій лінійці. Паралельно Alibaba опублікувала повну таблицю бенчмарків.
Згідно з ними, Qwen3.8-Max набирає 86,6 бала в Terminal-Bench 2.1 — агентному тесті на здатність до програмування, де OpenAI GPT-5.6 Sol залишається лідером з показником 88,8. У SWE-bench Pro модель Alibaba показала 67,7 проти 80,0 у Anthropic Claude Fable 5. А в OSWorld-Verified, бенчмарку на керування комп’ютером, Qwen3.8-Max заявив результат 86,1 проти 83,2 у Sol.
Жодна незалежна лабораторія ще не відтворила ці дані. За словами Alibaba, модель без участі людини протягом 16 днів розробляла консольний інструмент: отримувала запити користувачів, генерувала робочий код і сама ж запускала тести. Розробники у відповідь поставили під сумнів як саме демо, так і умови ліцензування.
Також читайте: iPhone 18 Pro Max може стати першим з 2-нм чипом Apple і прискоренням на 15%
Іон Стоїка: відставання Китаю скоротилось до кількох місяців
Іон Стоїка, комп’ютерний науковець Каліфорнійського університету в Берклі та співзасновник платформи бенчмарків Arena, наприкінці липня оцінював, що китайські моделі з відкритими вагами відстають від американських фронтир-лабораторій уже лише на два–три місяці. Раніше він говорив про лаг у шість–дев’ять місяців. Зближення, за його словами, відображає рік активних відкритих релізів від DeepSeek та лінійки GLM від Z.ai.
«Зараз усе вирішує ціна», — пояснює Харпріт Арора, керівник напрямку агентної інфраструктури у Vercel. За його словами, інженерні команди женуть «рутинну» роботу в той дешевший модельний стек, який просто проходить необхідний поріг якості. Джастін Саммервілл з OpenRouter порахував, що відкриті китайські системи обходяться на 60–90% дешевше. Маршрутизація запитів відповідно слідує «сухій математиці» витрат.
Ціноутворення GPT-5.6: захист масового сегмента
OpenAI знизила вартість тарифу Luna на 80% 30 липня — лише через три тижні після запуску сімейства GPT-5.6. Тепер це 0,20 долара за мільйон вхідних токенів і 1,20 долара за мільйон вихідних. Тариф Terra подешевшав на 20%, тоді як флагманський Sol зберіг прайс 5 і 30 доларів відповідно.
Така структура підтримує преміум-ціну на флагмані й одночасно дозволяє нижчим тарифам боротися за обсяги, які китайські лабораторії відбирають упродовж усього року.
Моделі китайського походження виросли з 4,5% частки токенів на одній з великих маршрутних платформ США в першій половині 2025 року до понад 30% щотижня з лютого, досягаючи піку в 46%. Дослідники Стенфордського університету зафіксували, що у березні відрив найсильнішої американської моделі в бенчмарках становив усього 2,7% — проти до 31,6 процентного пункту у 2023-му.
Читайте далі: Bitcoin може перетворити «екстремальний страх» на паливо для ралі до $75 тис.






