Grok 4.5 deu novo fôlego ao argumento de custo-benefício de Elon Musk depois de liderar um benchmark independente de agentes de IA.
Principais destaques:
- Grok 4.5 marcou 51,4% no AutomationBench-AA, à frente de dois modelos Claude.
- O custo foi de US$ 0,34 por tarefa, bem abaixo dos rivais da Anthropic.
- A maior taxa de violações de regras segue sendo risco para uso corporativo em agentes.
O desempenho do Grok no benchmark
A consultoria Artificial Analysis informou que o Grok 4.5 alcançou 51,4% no AutomationBench-AA, superando o Claude Fable 5, com 48,6%, e o Claude Opus 4.8, com 48,5%. O modelo também se destacou em custo, com US$ 0,34 por tarefa, contra US$ 1,35 do Fable 5 e US$ 1,46 do Opus 4.8.
O resultado adiciona uma validação externa à narrativa de Musk de que o Grok 4.5 é um modelo da classe Opus, porém mais rápido e mais barato. A SpaceXAI tornou o modelo público nesta semana, apoiando o lançamento em uma fundação V9 de 1,5 trilhão de parâmetros e em avaliações internas preliminares.
O AutomationBench-AA reúne 657 tarefas em 40 aplicações simuladas, incluindo Gmail, Slack, Salesforce e HubSpot. O teste mede se um agente de IA consegue concluir objetivos sem violar guardrails, e a Artificial Analysis mantém o conjunto de tarefas fechado para minimizar contaminação de benchmark.
Veja também: Grok 4.5 desafia OpenAI e Anthropic com IA de agentes mais barata
A aposta ousada de Musk
Segundo a Artificial Analysis, o Grok 4.5 utilizou cerca de 8.000 tokens de saída por tarefa, aproximadamente um quarto do volume do Opus 4.8. “O uso total de tokens, de 0,44 milhão por tarefa, está entre os mais baixos do ranking”, destacou a consultoria, atribuindo o menor custo à eficiência e à política de preços por token.
O modelo concluiu 79,9% dos objetivos das tarefas e finalizou 21,9% das tarefas com sucesso total. Em finanças, apontado como o domínio mais desafiador do benchmark, o Grok 4.5 liderou com 71%, ante 64% do Fable 5 e 62% do Opus 4.8.
A fragilidade apareceu na conformidade regulatória. O Grok 4.5 registrou 0,63 violações de guardrails por tarefa, acima dos 0,55 do Opus 4.8 e dos 0,46 do Gemini 3.5 Flash, da Google – um diferencial sensível para empresas que pretendem operar agentes próximos de sistemas financeiros em produção.
Na apresentação de lançamento, Musk enfatizou um trade-off prático em vez de uma vitória limpa em todos os critérios do benchmark. O Grok 4.5 agora conta com validação externa em custo e velocidade, mas a taxa mais elevada de violações de regras ajuda a explicar por que a adoção corporativa ainda deverá depender da percepção de confiabilidade.
Leia a seguir: Bitcoin enfrenta recuperação com problema de demanda que touros não podem ignorar





