Qwen3.8-Max vs. GPT-5.6: o modelo de 2,4 trilhões de parâmetros da Alibaba que mira o carro-chefe da OpenAI

Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)
Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)

Alibaba lançou o Qwen3.8-Max, modelo de 2,4 trilhões de parâmetros nesta semana, em um momento em que sistemas chineses já respondem por até 46% do tráfego de tokens de empresas nos EUA, pressionando o GPT-5.6 da OpenAI.

Pontos-chave:

  • O Qwen3.8-Max, da Alibaba, soma 2,4 trilhões de parâmetros no total e ativa 95 bilhões por requisição; os pesos abertos foram prometidos para a próxima semana.
  • O GPT-5.6 Sol ainda lidera o benchmark de “agentic coding” divulgado pela Alibaba, mas com vantagem estreita e sem validação independente.
  • A OpenAI cortou em 80% o preço de sua camada mais barata em 30 de julho, três semanas após o lançamento, à medida que modelos chineses ganham volume.

Qwen3.8-Max testa o GPT-5.6 Sol nos benchmarks

A Alibaba apresentou o modelo em 3 de agosto. Trata-se de um sistema “mixture-of-experts” com 2,4 trilhões de parâmetros totais, mas que ativa apenas 95 bilhões em cada chamada.

A companhia afirmou que os pesos abertos do modelo principal e de uma versão menor, com 27 bilhões de parâmetros, serão publicados em repositórios públicos na próxima semana, revertendo uma sequência de lançamentos fechados na sua linha topo de gama. A Alibaba também divulgou uma tabela completa de benchmarks.

Pelos números da empresa, o Qwen3.8-Max alcançou 86,6 pontos no Terminal-Bench 2.1, teste de codificação com agentes em que o GPT-5.6 Sol, da OpenAI, ainda lidera com 88,8. No SWE-bench Pro, o modelo marcou 67,7, contra 80,0 do Claude Fable 5, da Anthropic, e, no OSWorld-Verified, benchmark de uso de computador, alegou 86,1 pontos frente a 83,2 do Sol.

Nenhum laboratório independente reproduziu esses resultados até agora. Segundo a Alibaba, o Qwen3.8-Max passou 16 dias construindo, sem intervenção humana, uma ferramenta de linha de comando capaz de transformar pedidos de usuários em código funcional e executar seus próprios testes. Desenvolvedores contestaram a demonstração e os termos de licença.

Veja também: iPhone 18 Pro Max pode ser o primeiro com chip de 2 nm da Apple, 15% mais rápido

Ion Stoica avalia a redução da distância da China

Ion Stoica, cientista da computação da Universidade da Califórnia em Berkeley e cofundador da plataforma de benchmarks Arena, avaliou no fim de julho que os modelos chineses de pesos abertos hoje estão apenas dois ou três meses atrás dos laboratórios de ponta dos EUA. Ele antes estimava um atraso de seis a nove meses — mudança que acompanha um ano de lançamentos abertos da DeepSeek e da linha GLM da Z.ai.

“Preço é o que está fazendo diferença aqui”, disse Harpreet Arora, responsável por infraestrutura de agentes na Vercel, ao descrever equipes de engenharia que encaminham o trabalho rotineiro para qualquer modelo barato que passe no corte de qualidade. Justin Summerville, da OpenRouter, calculou que sistemas chineses abertos custam de 60% a 90% menos. O roteamento segue a matemática.

Preços do GPT-5.6 defendem o segmento de maior volume

A OpenAI reduziu em 80% o preço da camada Luna em 30 de julho, três semanas após o lançamento da família GPT-5.6, para US$ 0,20 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída. A camada Terra ficou 20% mais barata, enquanto o carro-chefe Sol foi mantido em US$ 5 e US$ 30.

A estratégia preserva um prêmio na parte de cima da linha, enquanto as camadas mais baratas disputam o volume que laboratórios chineses vêm conquistando ao longo do ano.

Modelos de origem chinesa avançaram de 4,5% do volume de tokens nos EUA em uma grande plataforma de roteamento no primeiro semestre de 2025 para mais de 30% semanalmente desde fevereiro, chegando ao pico de 46%. Pesquisadores de Stanford University registraram em março que a vantagem do principal modelo americano nos benchmarks havia caído para 2,7 pontos percentuais, ante até 31,6 pontos em 2023.

Próxima leitura: Bitcoin pode transformar medo extremo em combustível para uma alta até US$ 75 mil

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head de Conteúdo da Yellow.com, tendo coberto o setor de cripto nos últimos 10 anos. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Qwen3.8-Max vs. GPT-5.6: o modelo de 2,4 trilhões de parâmetros da Alibaba que mira o carro-chefe da OpenAI | Yellow