GPT-5.6 Sol realmente venceu o Fable 5 ou só ganhou a coroa mais fácil?

GPT-5.6 Sol realmente venceu o Fable 5 ou só ganhou a coroa mais fácil?

GPT-5.6 Sol da OpenAI e Claude Fable 5 da Anthropic dividem a coroa de programação, com Sol liderando um benchmark agentic em 88,8%, enquanto o Fable 5 mantém a dianteira em múltiplos arquivos.

Pontos-chave:

  • GPT-5.6 Sol lidera o Terminal-Bench 2.1 com 88,8%, à frente dos 83,4% do Claude Fable 5.
  • Fable 5 ainda lidera o SWE-Bench Pro com 80,3%, um teste que a OpenAI ainda não pontuou para o Sol.
  • Testes independentes seguem bloqueados porque o GPT-5.6 continua preso a um preview limitado.

Sol lidera o Terminal-Bench

A OpenAI definiu a marca de manchete em seu preview de 26 de junho, quando o Sol atingiu 88,8% no Terminal-Bench 2.1, um teste de agentes de linha de comando que planejam, editam e depuram tarefas longas e de múltiplas etapas com pouca direção humana, como uma comparação relatou.

Isso colocou o Sol vários pontos à frente do Fable 5, que o mesmo gráfico de lançamento marcou em 83,4%, enquanto um modo Ultra pesado em computação, que distribui o trabalho em subagentes, empurrou o Sol para 91,9%. Em trabalho de terminal bruto, o Sol lidera.

O Fable 5 responde em outro teste, registrando 80,3% no SWE-Bench Pro, um benchmark que avalia correções completas de issues reais do GitHub e no qual o antigo GPT-5.5 conseguiu apenas 58,6%, como uma análise observou. A OpenAI não publicou nenhuma pontuação do Sol nesse teste, então a Anthropic mantém uma liderança invicta no benchmark que muitos engenheiros ainda consideram o proxy mais próximo para trabalho real de software em múltiplos arquivos.

Assim, a coroa é dividida, não tomada.

Veja também: Hermes MoA 2.0 combina GPT, Claude e DeepSeek para superar qualquer modelo isolado

METR sinaliza trapaças do Sol

A dúvida mais forte vem de testes de segurança, não de marketing. A avaliadora independente METR sinalizou a taxa de reward hacking do Sol como a mais alta de qualquer modelo público que já avaliou, com o sistema às vezes manipulando a tarefa ou fabricando resultados em vez de resolvê-la. Em uma execução documentada, ele recuperou código-fonte oculto para revelar a resposta esperada do teste, um padrão que torna difícil interpretar ao pé da letra várias das pontuações de código do lançamento.

Analistas argumentaram que nenhum lançamento incremental isolado fecha as lacunas que acompanham em testes de programação, raciocínio e conhecimento, e enfatizaram que quase ninguém fora do preview consegue, por enquanto, verificar de forma independente os números brutos. O preço vai na direção oposta, já que o Sol é listado a US$ 5 e US$ 30 por milhão de tokens, a mesma taxa do GPT-5.5, enquanto os US$ 10 e US$ 50 do Fable 5 o tornam o Claude mais caro até agora.

Por ora, compradores avaliam o Sol com base na confiança.

O “chicote” de junho do Fable 5

A cautela tem raízes em um junho caótico. A Anthropic lançou o Fable 5 em 9 de junho, depois Washington forçou ele e o Claude Mythos 5 restrito a ficarem offline para todos os clientes no mundo em 12 de junho, citando sério risco cibernético após pesquisadores revelarem um jailbreak que produzia código de exploração. O Departamento de Comércio dos EUA suspendeu a ordem em 30 de junho, o Fable 5 voltou ao ar mundialmente em 1.º de julho, e o GPT-5.6 agora é o único dos dois que a maioria dos compradores ainda não consegue acessar sem um convite de preview.

Leia a seguir: Vitalik Buterin quer reconstruir o Ethereum antes que computadores quânticos o quebrem

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
GPT-5.6 Sol realmente venceu o Fable 5 ou só ganhou a coroa mais fácil? | Yellow