Grok 4.5 deu novo fôlego à tese de custo-benefício de Elon Musk após aparecer em primeiro lugar em um benchmark independente de agentes.
Principais pontos:
- Grok 4.5 alcançou 51,4% no AutomationBench-AA, à frente de dois modelos Claude.
- O custo foi de US$ 0,34 por tarefa, bem abaixo dos rivais imediatos da Anthropic.
- A taxa mais alta de violação de regras segue sendo risco para uso corporativo de agentes.
Desempenho do Grok
A Artificial Analysis afirmou que o Grok 4.5 obteve 51,4% no AutomationBench-AA, superando o Claude Fable 5, com 48,6%, e o Claude Opus 4.8, com 48,5%. O modelo também apresentou custo de apenas US$ 0,34 por tarefa, contra US$ 1,35 do Fable 5 e US$ 1,46 do Opus 4.8.
O resultado acrescenta uma validação externa ao discurso de Musk de que o Grok 4.5 é um modelo da classe Opus, porém mais rápido e mais barato. A SpaceXAI levou o modelo ao público nesta semana, apoiando-se em uma base V9 de 1,5 trilhão de parâmetros e em avaliações internas preliminares para sustentar o lançamento.
O AutomationBench-AA reúne 657 tarefas em 40 apps simulados, incluindo Gmail, Slack, Salesforce e HubSpot. O teste mede se um agente de IA consegue cumprir objetivos sem romper os guardrails, e a Artificial Analysis mantém o conjunto de tarefas fechado para reduzir contaminação de benchmark.
Veja também: Grok 4.5 desafia OpenAI e Anthropic com IA de agentes mais barata
A aposta de Musk
Segundo a Artificial Analysis, o Grok 4.5 usou cerca de 8.000 tokens de saída por tarefa, algo em torno de um quarto do volume do Opus 4.8. “Seu uso total de tokens, de 0,44 milhão por tarefa, está entre os mais baixos do ranking”, disse a empresa, atribuindo o baixo custo à combinação de eficiência e precificação de tokens.
O modelo concluiu 79,9% dos objetivos de tarefa e finalizou integralmente 21,9% das tarefas. Em finanças — o domínio mais difícil do benchmark —, o Grok 4.5 liderou com 71%, ante 64% do Fable 5 e 62% do Opus 4.8.
A fragilidade apareceu na conformidade. O Grok 4.5 registrou em média 0,63 violações de guardrails por tarefa, acima do Opus 4.8, com 0,55, e do Gemini 3.5 Flash, da Google, com 0,46 — uma diferença relevante para empresas que usam agentes próximos de sistemas financeiros em produção.
A mensagem de lançamento de Musk enfatizou um trade-off pragmático, e não uma vitória limpa em todos os critérios. O Grok 4.5 agora conta com validação externa em custo e velocidade, mas a taxa mais alta de violações de regras mostra por que a adoção corporativa ainda dependerá da percepção de confiabilidade.
Leia a seguir: A recuperação do Bitcoin enfrenta um problema de demanda que os touros não podem ignorar





