Grok 4.5 supera Fable 5 e Opus 4.8 em teste de IA de agentes com 51,4% de acerto

Grok 4.5 supera Fable 5 e Opus 4.8 em teste de IA de agentes com 51,4% de acerto

Grok 4.5 deu novo fôlego ao argumento de custo-benefício de Elon Musk depois de liderar um benchmark independente de agentes de IA.

Principais destaques:

  • Grok 4.5 marcou 51,4% no AutomationBench-AA, à frente de dois modelos Claude.
  • O custo foi de US$ 0,34 por tarefa, bem abaixo dos rivais da Anthropic.
  • A maior taxa de violações de regras segue sendo risco para uso corporativo em agentes.

O desempenho do Grok no benchmark

A consultoria Artificial Analysis informou que o Grok 4.5 alcançou 51,4% no AutomationBench-AA, superando o Claude Fable 5, com 48,6%, e o Claude Opus 4.8, com 48,5%. O modelo também se destacou em custo, com US$ 0,34 por tarefa, contra US$ 1,35 do Fable 5 e US$ 1,46 do Opus 4.8.

O resultado adiciona uma validação externa à narrativa de Musk de que o Grok 4.5 é um modelo da classe Opus, porém mais rápido e mais barato. A SpaceXAI tornou o modelo público nesta semana, apoiando o lançamento em uma fundação V9 de 1,5 trilhão de parâmetros e em avaliações internas preliminares.

O AutomationBench-AA reúne 657 tarefas em 40 aplicações simuladas, incluindo Gmail, Slack, Salesforce e HubSpot. O teste mede se um agente de IA consegue concluir objetivos sem violar guardrails, e a Artificial Analysis mantém o conjunto de tarefas fechado para minimizar contaminação de benchmark.

Veja também: Grok 4.5 desafia OpenAI e Anthropic com IA de agentes mais barata

A aposta ousada de Musk

Segundo a Artificial Analysis, o Grok 4.5 utilizou cerca de 8.000 tokens de saída por tarefa, aproximadamente um quarto do volume do Opus 4.8. “O uso total de tokens, de 0,44 milhão por tarefa, está entre os mais baixos do ranking”, destacou a consultoria, atribuindo o menor custo à eficiência e à política de preços por token.

O modelo concluiu 79,9% dos objetivos das tarefas e finalizou 21,9% das tarefas com sucesso total. Em finanças, apontado como o domínio mais desafiador do benchmark, o Grok 4.5 liderou com 71%, ante 64% do Fable 5 e 62% do Opus 4.8.

A fragilidade apareceu na conformidade regulatória. O Grok 4.5 registrou 0,63 violações de guardrails por tarefa, acima dos 0,55 do Opus 4.8 e dos 0,46 do Gemini 3.5 Flash, da Google – um diferencial sensível para empresas que pretendem operar agentes próximos de sistemas financeiros em produção.

Na apresentação de lançamento, Musk enfatizou um trade-off prático em vez de uma vitória limpa em todos os critérios do benchmark. O Grok 4.5 agora conta com validação externa em custo e velocidade, mas a taxa mais elevada de violações de regras ajuda a explicar por que a adoção corporativa ainda deverá depender da percepção de confiabilidade.

Leia a seguir: Bitcoin enfrenta recuperação com problema de demanda que touros não podem ignorar

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Grok 4.5 supera Fable 5 e Opus 4.8 em teste de IA de agentes com 51,4% de acerto | Yellow