Grok 4.5 e GPT-5.6 chegaram ao mercado com um dia de diferença, dividindo as avaliações entre a pontuação de 91,9% em tarefas de código “agêntico” da OpenAI e o desafio de preço da SpaceXAI, que cobra US$ 2 por milhão de tokens — mirando diretamente a precificação de ponta do setor.
Pontos-chave:
- GPT-5.6 Sol lidera a maior parte dos benchmarks diretos, enquanto o Grok 4.5 vence em preço, velocidade e economia de tokens.
- Testadores independentes colocam o Grok 4.5 em 4º lugar em inteligência e destacam taxa de alucinação que dobrou, chegando a 54%.
- Avaliadores preferem GPT-5.6 para escrita e longas sessões de programação, e Grok 4.5 para trabalho de alto volume com orçamento apertado.
Benchmarks: Grok 4.5 vs GPT-5.6
A SpaceXAI lançou o Grok 4.5 em 8 de julho. A OpenAI respondeu no dia seguinte com o GPT-5.6, uma família que combina o topo de linha Sol com os níveis mais baratos Terra e Luna. A firma de benchmarks Artificial Analysis colocou o novo Grok na 4ª posição de seu Índice de Inteligência, com 54 pontos, atrás de Claude Fable 5, GPT-5.5 e Opus 4.8.
No confronto direto, a balança pende para a OpenAI. Um placar preliminar aponta 86 pontos para GPT-5.6 Sol contra 82 do Grok 4.5, impulsionado por uma diferença de 91,9% para 83,3% em tarefas agênticas baseadas em terminal, enquanto as médias em programação ficam praticamente empatadas: 64,7 versus 64,6.
A OpenAI afirma que o Sol, com raciocínio no máximo, estabelece um recorde de 80 pontos no independente Coding Agent Index, em que o Grok 4.5 marca 76 dentro de seu ambiente Grok Build. Na economia, porém, o fluxo se inverte. O Grok cobra US$ 2 por milhão de tokens de entrada, contra US$ 5 do Sol, e uma tarefa de código concluída sai por US$ 2,49, ante US$ 11,80 do Fable 5.
Leia também: Apostas nos Dodgers chegam a US$ 68 mi enquanto Polymarket e Kalshi surfam corrida aos playoffs da MLB
Código, escrita e tarefas do dia a dia
Relatos práticos mostram o mesmo racha. Em um teste de longo prazo, um ambiente de avaliação encontrou o Sol concluindo 63,7% de mais de 100 tarefas reais em repositórios sem erros de tentativa, mantendo o rumo em checklists complexas e cheias de etapas. Outro teste independente de programação deu nota 92 de 100 ao Sol e 87 ao Grok 4.5, empatando este último com os melhores modelos de pesos abertos.
Entre redatores, a tendência é semelhante: avaliadores iniciais descrevem o Sol como “carro-chefe do dia a dia”, capaz de cobrir cerca de 80% do trabalho de conhecimento rotineiro e de seguir manuais de estilo com mais disciplina que rivais.
O Grok 4.5 responde com velocidade e obediência. Quem rodou o modelo em tarefas reais relatou entregas limpas logo na primeira tentativa, saída estruturada consistente e respostas abaixo de cinco segundos, com cerca de 80 tokens por segundo. O porém é a precisão: a taxa medida de alucinações saltou de 25% para 54%, mesmo com a acurácia factual subindo para 52%.
Vereditos dos especialistas e dúvidas de confiança
Elon Musk apresentou o Grok 4.5 como “um modelo de classe Opus, porém mais rápido, mais eficiente em tokens e mais barato”. Alguns analistas argumentam que a diferença de preço pesa mais que o gap de pontuação, já que o Grok queima 1,9 milhão de tokens por tarefa, contra 7,2 milhões do Fable 5.
Céticos veem motivos para cautela. Avaliadores observaram que as pontuações de lançamento vieram dos próprios fornecedores, que nenhum “model card” foi publicado e que a Cursor retirou um benchmark interno depois que o Grok foi treinado por engano em seu código proprietário. O GPT-5.6 também vem com asterisco: o system card da OpenAI reconhece que o modelo desobedece instruções com mais frequência que seu antecessor.
A rivalidade coroou um período turbulento. A SpaceX incorporou a xAI em fevereiro, comprou a Cursor por US$ 60 bilhões em junho e renomeou o laboratório para SpaceXAI dois dias antes da chegada do Grok 4.5. A OpenAI passou o fim de junho com o Sol travado em revisão governamental, enquanto o Fable 5 da Anthropic, ainda líder publicado em benchmarks, só voltou em 1º de julho após uma suspensão de 19 dias.
Próximo assunto: Ethereum ganha terreno sobre o Bitcoin e testa tese de alta de Tom Lee para 2026






