Analistas se dividem sobre Claude Opus 5 após primeiros testes independentes

Analistas se dividem sobre Claude Opus 5 após primeiros testes independentes

Avaliadores independentes atribuíram 159 pontos ao novo modelo da Anthropic, o Claude Opus 5, em um dos principais índices de capacidade — apenas dois pontos abaixo do Claude Fable 5 —, enquanto as opiniões se chocam em relação ao seu desempenho em revisão de código.

Principais destaques:

  • A Epoch AI avaliou o Claude Opus 5 em 159 pontos em seu índice de capacidades, ante 161 do Claude Fable 5, com empate em engenharia de software.
  • A CodeRabbit registrou 39,3% de precisão em comentários de revisão realmente acionáveis, acima de uma base de 35,2%, mas com quatro vezes mais comentários supérfluos.
  • Clientes corporativos na Cognition e na Zapier relataram ganhos em debug e automação de fluxos de negócios ponta a ponta.

Benchmarks do Claude Opus 5 já enfrentam questionamentos

A Anthropic lançou o modelo na sexta-feira e afirmou que ele se aproxima da “inteligência de fronteira” do Fable 5 a metade do preço, posicionando o Opus 5 como ferramenta de uso diário, e não como solução de nicho. Avaliadores externos em geral concordaram — mas divergem no quão perto ele realmente chega.

A Epoch AI colocou o Opus 5 em 159 pontos em seu índice proprietário, contra 161 do Fable 5, e classificou ambos como equivalentes em engenharia de software, segundo um compilado do Latent Space mostrou.

Já a Artificial Analysis ranqueou o modelo em primeiro lugar em seu benchmark de “agentic knowledge work”, superando o Fable 5 em quase 150 pontos de Elo e reduzindo o custo por tarefa em cerca de 20%. Alguns desenvolvedores, porém, contestaram o índice de capacidades: para eles, um avanço de apenas um ponto em relação ao antigo Opus 4.8 subestima de forma grosseira as melhorias percebidas no uso diário. Em um dos testes, um avaliador relatou que um nível “médio” de esforço superou ajustes mais agressivos em um exame de código.

Veja também: BitMEX está fechando as portas após 11 anos sem encontrar comprador

Julgamentos sobre revisão de código expõem divergências

A CodeRabbit colocou o Opus 5 frente a cerca de 100 padrões de erro extraídos de pull requests reais de projetos open source, com três execuções por configuração, e mediu 39,3% de precisão em comentários de revisão considerados realmente acionáveis.

O resultado superou a base de 35,2% registrada pelo seu revisor em produção, mas com ressalvas importantes: o modelo identificou menos bugs já conhecidos e gerou quatro vezes mais “nitpicks” — observações de baixo valor que engenheiros ainda precisam filtrar manualmente.

No nível de esforço padrão, a precisão caiu para 26,4%. A conclusão da empresa é que equipes deveriam tratar o Opus 5 como um segundo revisor, focado em precisão, e não como um upgrade direto para pipelines de revisão que já funcionam bem. Claire Vo, que conduz uma avaliação comparativa com sete modelos para times de produto, classificou o modelo como “brilhante, mas irritante”, apontando um comportamento quase neurótico e citando um conflito de merge que o sistema se recusou terminantemente a resolver.

Clientes da Anthropic relatam ganhos em agentes e automação

Scott Wu, CEO da Cognition, afirmou que o Opus 5 se aproxima do desempenho de nível Fable dentro do Devin a metade do custo, com destaque para tarefas de debug e análise de causa raiz. Wade Foster, CEO da Zapier, disse que o modelo assumiu o topo do ranking interno de automação da empresa sem consumir mais tokens do que versões anteriores do Claude, mantidas ao mesmo preço de US$ 5 por milhão de tokens de entrada.

O entusiasmo, no entanto, vem com limitações claras. A própria Anthropic ressaltou que o Opus 5 fica atrás do modelo Mythos 5 em tarefas de cibersegurança ofensiva, e que solicitações sinalizadas pelos classificadores de segurança da companhia são automaticamente redirecionadas para o Opus 4.8.

A cautela se segue a um período conturbado para a linha de ponta: o Fable 5 foi lançado em junho, retirado do ar poucos dias depois e só voltou aos usuários no início de julho.

Próximo assunto: Ações da HubSpot caem 12,7% e analistas apontam para o novo agente da OpenAI

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Analistas se dividem sobre Claude Opus 5 após primeiros testes independentes | Yellow