Qwen3.8-Max vs. GPT-5.6: o modelo de 2,4 biliões de parâmetros que enfrenta o carro‑chefe da OpenAI

Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)
Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)

Qwen3.8-Max, o modelo de 2,4 biliões de parâmetros da Alibaba chegou esta semana, num momento em que sistemas chineses já respondem por até 46% do tráfego de tokens de empresas norte‑americanas, pressionando o GPT-5.6 da OpenAI.

Pontos-chave:

  • O Qwen3.8-Max da Alibaba tem 2,4 biliões de parâmetros no total e ativa 95 mil milhões por pedido, com pesos abertos prometidos para a próxima semana.
  • O GPT-5.6 Sol continua a liderar o benchmark de programação agentiva divulgado pela Alibaba, mas com margens estreitas e ainda sem validação independente.
  • A OpenAI cortou em 80% o preço do escalão mais barato em 30 de julho, três semanas após o lançamento, à medida que modelos chineses ganham volume.

Benchmarks do Qwen3.8-Max colocam à prova o GPT-5.6 Sol

A Alibaba apresentou o modelo em 3 de agosto: um sistema “mixture‑of‑experts” com 2,4 biliões de parâmetros totais, mas que ativa apenas 95 mil milhões em cada solicitação individual.

A empresa adiantou que irá disponibilizar pesos abertos para o modelo de referência e para uma versão mais pequena, de 27 mil milhões de parâmetros, em repositórios públicos já na próxima semana, revertendo uma sequência de lançamentos fechados da sua gama topo de linha. A Alibaba também divulgou uma tabela completa de benchmarks.

Os números colocam o Qwen3.8-Max com 86,6 pontos no Terminal‑Bench 2.1, um teste de programação agentiva em que o GPT-5.6 Sol da OpenAI ainda lidera, com 88,8. No SWE‑bench Pro, o Qwen3.8-Max alcançou 67,7, face aos 80,0 do Claude Fable 5 da Anthropic; já no OSWorld‑Verified, um teste de utilização de computador, o modelo reivindica 86,1 pontos contra 83,2 do Sol.

Nenhum laboratório independente reproduziu ainda estes resultados. Segundo a Alibaba, o modelo passou 16 dias a desenvolver uma ferramenta de linha de comando sem intervenção humana, convertendo pedidos de utilizadores em código funcional e executando os seus próprios testes. Programadores contestaram tanto a demonstração como os termos de licenciamento.

Leia também: iPhone 18 Pro Max poderá estrear chip de 2 nm da Apple, 15% mais rápido

Ion Stoica avalia o estreitamento da diferença com a China

Ion Stoica, cientista da computação na Universidade da Califórnia, Berkeley, e cofundador da plataforma de benchmark Arena, avaliou no final de julho que os modelos chineses de pesos abertos estão agora apenas dois a três meses atrás dos laboratórios de fronteira norte‑americanos. Antes, estimava o atraso entre seis e nove meses, uma mudança que acompanha um ano de lançamentos abertos da DeepSeek e da linha GLM da Z.ai.

“O preço é o fator decisivo aqui”, afirmou Harpreet Arora, responsável pela infraestrutura agentiva na Vercel, descrevendo equipas de engenharia que encaminham o trabalho rotineiro para qualquer modelo barato que cumpra os requisitos mínimos. Justin Summerville, da OpenRouter, apurou que sistemas chineses abertos custam entre menos 60% e 90%. O roteamento segue a matemática.

Preços do GPT-5.6 defendem o segmento de volume

A OpenAI reduziu em 80% o preço do escalão Luna em 30 de julho, três semanas após o lançamento da família GPT-5.6, para 0,20 dólares por milhão de tokens de entrada e 1,20 dólares por milhão de tokens de saída. O plano Terra ficou 20% mais barato, enquanto o modelo de topo, Sol, se mantém em 5 e 30 dólares.

A estrutura mantém um prémio claro no topo da gama, enquanto os escalões mais acessíveis travam a batalha pelo volume que laboratórios chineses vêm conquistando ao longo do ano.

Modelos de origem chinesa subiram de 4,5% do volume de tokens nos EUA numa grande plataforma de roteamento no primeiro semestre de 2025 para mais de 30% todas as semanas desde fevereiro, atingindo um pico de 46%. Investigadores da Universidade de Stanford registaram em março uma vantagem de apenas 2,7 pontos percentuais para o melhor modelo norte‑americano, contra margens que chegavam a 31,6 pontos em 2023.

A seguir: Medo extremo pode alimentar rali do Bitcoin rumo aos 75 mil dólares

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head of Content na Yellow.com, tendo reportado sobre cripto nos últimos 10 anos. Ele se especializa em artigos aprofundados de Research e Learn, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para ajudar a tornar isso realidade.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.