Anthropic lançou nesta segunda-feira o Claude Sonnet 5.5, afirmando que o novo modelo de IA de categoria intermediária roda mais de 30% mais rápido e custa até 30% menos por tarefa do que a versão anterior.
Pontos-chave:
- Sonnet 5.5 marcou 70,6% no teste de programação Terminal-Bench 4.0, ante 10,3% do Sonnet 5.
- É o primeiro modelo Sonnet lançado já com salvaguardas cibernéticas antes restritas aos sistemas mais potentes da Anthropic.
- Um benchmark independente teria apontado custo maior por tarefa que o Sonnet 5 em cenários de esforço máximo.
Desempenho do Claude Sonnet 5.5
O Sonnet 5.5 é o segundo modelo da família Claude 5.5 e chegou seis dias depois do carro-chefe Claude Opus 5.5, informou a companhia em seu anúncio de lançamento aqui.
A Anthropic o posiciona como um complemento mais rápido e barato ao Opus 5.5, voltado para tarefas do dia a dia bem delimitadas, correção de bugs e geração de documentos, apresentações e planilhas mais refinados. A tabela de preços é de US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída.
No Terminal-Bench 4.0, um teste de programação com agente autônomo, o Sonnet 5.5 alcançou 70,6%, contra 10,3% do Sonnet 5 e 66,4% do Opus 5.5, mais caro. O modelo também se tornou o primeiro Sonnet a zerar Pokémon Red usando apenas capturas de tela, um teste de tarefas de longo prazo e compreensão de imagens.
O modelo agora está disponível em todas as plataformas da Anthropic, incluindo Amazon Web Services, Google Cloud e Microsoft Azure. A empresa afirmou que o menor Claude Haiku 5.5, voltado a volumes muito altos e forte sensibilidade a custo, será lançado nas próximas semanas, fechando o portfólio de três modelos.
Veja também: OpenAI pisa no freio em Frontier AI após fuga de sandbox em 20 de setembro
Salvaguardas e custos do Sonnet 5.5
A Anthropic citou Daniel Vogel, diretor de operações da Epic Games, que disse que o modelo lidou com dezenas de milhares de linhas de código de sistemas de gameplay nos testes iniciais. Segundo Vogel, o Sonnet 5.5 “atingiu o mesmo nível de qualidade que se esperaria de um modelo de faixa superior”.
Como suas capacidades cibernéticas são comparáveis às do Opus 5, o Sonnet 5.5 é o primeiro modelo da linha a estrear com as salvaguardas que a Anthropic reservava às suas IAs mais avançadas. A correção rotineira de erros não é afetada, mas solicitações cibernéticas de maior risco passam visivelmente a ser rebaixadas para o Sonnet 5. Novos classificadores também bloqueiam tentativas de extrair o raciocínio interno do sistema.
Nem todos os testes corroboram a narrativa de redução de custos. A consultoria Artificial Analysis teria medido um custo ponderado de US$ 7,60 por tarefa de benchmark em esforço máximo, frente a US$ 5,09 no Sonnet 5, ainda que o índice de performance do novo modelo tenha subido para 56, ante 38.
O lançamento ocorre logo após a estreia do Opus 5.5 em 22 de setembro, quando a Anthropic reduziu em 20% o preço do modelo topo de linha, para US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de tokens de saída. Na ocasião, a empresa afirmou que o Opus 5.5 custaria cerca de 40% menos que o Opus 5 em cargas de trabalho típicas e geraria respostas mais de 30% mais rápidas. A OpenAI lançou no mesmo dia o GPT-6 Sol e o GPT-6 Luna, com preços pela metade em relação às versões anteriores.
Leia a seguir: BlackRock diz que poder computacional caminha para o mercado de futuros

