Especialistas se dividem sobre o Claude Opus 5 após primeiros testes independentes

Especialistas se dividem sobre o Claude Opus 5 após primeiros testes independentes

Avaliadores independentes atribuíram 159 pontos ao novo modelo da Anthropic, o Claude Opus 5, em um dos principais índices de capacidade — dois pontos abaixo do Claude Fable 5 — e chegaram a conclusões bastante distintas sobre sua performance em revisão de código.

Principais pontos:

  • A Epoch AI avaliou o Claude Opus 5 em 159 pontos em seu índice de capacidades, contra 161 do Claude Fable 5, com empate em engenharia de software.
  • A CodeRabbit apurou 39,3% de precisão em comentários de revisão realmente úteis, acima da base de 35,2%, mas com quatro vezes mais “picuinhas”.
  • Times corporativos da Cognition e da Zapier relataram ganhos em depuração e automação de processos de ponta a ponta.

Benchmarks do Claude Opus 5 já são colocados à prova

A Anthropic lançou o modelo na sexta-feira e afirmou que ele chega próximo à “inteligência de fronteira” do Fable 5, cobrando metade do preço e sendo posicionado mais como ferramenta do dia a dia do que como solução especializada. Avaliadores externos em geral concordaram com o enquadramento, mas divergiram na avaliação fina.

A Epoch AI colocou o Opus 5 em 159 pontos no seu índice de capacidades, contra 161 do Fable 5, e considerou os dois equivalentes em engenharia de software, segundo um compilado da Latent Space mostrou.

A Artificial Analysis classificou o modelo em primeiro lugar em seu benchmark de trabalho de conhecimento “agentizado”, superando o Fable 5 por quase 150 pontos de Elo e reduzindo o custo por tarefa em 20%. Alguns desenvolvedores contestaram o índice de capacidades, argumentando que um ganho de apenas um ponto em relação ao Opus 4.8 subestima fortemente a melhora percebida no uso diário. Um avaliador relatou que o nível de esforço “médio” superou configurações mais agressivas em um teste de programação.

Leia também: BitMEX vai encerrar operações após 11 anos sem encontrar comprador

Vereditos sobre revisão de código dividem avaliadores

A CodeRabbit testou o Opus 5 contra cerca de 100 padrões de erro retirados de pull requests reais de projetos open source, com três passagens por configuração, e mediu 39,3% de precisão em comentários realmente acionáveis.

O resultado supera a base de 35,2% do revisor que está hoje em produção, mas o modelo identificou menos bugs já mapeados e gerou quatro vezes mais observações de baixo valor — os famosos “nitpicks” que engenheiros precisam filtrar manualmente.

Na configuração padrão de esforço, a precisão caiu para 26,4%. A empresa concluiu que times deveriam tratar o Opus 5 como um segundo revisor, mais focado em precisão, e não como um upgrade direto em pipelines que já funcionam. Claire Vo, que conduz uma avaliação comparando sete modelos para times de produto, classificou o modelo como brilhante, porém irritante, citando um viés “neurótico” e um conflito de merge que o sistema se recusou terminantemente a resolver.

Clientes da Anthropic relatam ganhos em agentes

Scott Wu, CEO da Cognition, disse que o Opus 5 se aproxima do desempenho do Fable a metade do custo dentro do Devin, com destaque para debugging e análise de causa raiz. Wade Foster, CEO da Zapier, afirmou que o modelo assumiu o topo do ranking interno de automação da empresa sem consumir mais tokens do que versões anteriores do Claude, mantidas no mesmo preço de US$ 5 por milhão de tokens de entrada.

O otimismo veio com ressalvas. A Anthropic ressaltou que o Opus 5 fica atrás do modelo Mythos 5 em tarefas ofensivas de cibersegurança e que solicitações sinalizadas pelos classificadores de segurança da companhia são automaticamente redirecionadas para o Opus 4.8.

A postura mais cautelosa ocorre após um período conturbado na faixa de modelos de ponta: o Fable 5 foi lançado em junho, retirado do ar poucos dias depois e só voltou aos usuários no início de julho.

Próximo artigo: HubSpot cai 12,7% e analistas culpam diretamente o novo agente da OpenAI

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Especialistas se dividem sobre o Claude Opus 5 após primeiros testes independentes | Yellow