OpenAI chama GPT-6 Astra de modelo mais inteligente; testadores discordam

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

O novo modelo GPT-6 Astra da OpenAI dividiu a opinião de especialistas poucos dias após o lançamento, com avaliadores independentes colocando-o atrás do Claude Fable 5.1 da Anthropic em raciocínio geral.

Principais pontos:

  • GPT-6 Astra lidera em testes de terminal e cibersegurança, mas fica atrás do Claude Fable 5.1 em benchmarks de raciocínio em nível de especialista.
  • A Artificial Analysis refez seu Intelligence Index em 5 de setembro, elevando o Astra em quatro pontos para a segunda posição, atrás do Fable 5.1.
  • O Astra custa US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, cerca de 6,7 vezes acima do Grok 4.6, da xAI.

As alegações de benchmark do GPT-6 Astra

A OpenAI começou a liberar o Astra em 3 de setembro, primeiro para um pequeno grupo de empresas parceiras e, no dia seguinte, para assinantes pagantes do ChatGPT.

A empresa chegou a afirmar que se trata do modelo mais inteligente e mais alinhado do mundo. A própria tabela de lançamento da companhia sustenta parte dessa narrativa, mas não toda.

O Astra marca 57,7% no Terminal-Bench 4.0, um teste de engenharia de software e configuração de sistemas, contra 55,8% do Claude Fable 5.1 e 19,1% do Gemini 3.8 Flash, do Google. O modelo também atingiu 100% no ExploitBench, métrica de cibersegurança na qual o antigo carro-chefe da OpenAI havia alcançado 78,5%.

Em outros indicadores, porém, o quadro muda. No Humanity's Last Exam com uso de ferramentas, um conjunto de questões em nível de especialista, o Astra atinge 57,2%, contra 65% do Fable 5.1 e 63,6% do Claude Opus 5. A OpenAI ressalta que os números publicados refletem configurações de “esforço máximo”, e não os padrões que a maioria dos assinantes encontrará no produto.

Veja também: Detentor de Bitcoin guarda US$ 120 por 15 anos e acorda com US$ 3,09 milhões

Especialistas contestam pontuação do Astra

A Artificial Analysis, que avalia modelos rivais em um ambiente de teste unificado e neutro, inicialmente classificou o Astra no mesmo nível de seu antecessor, enquanto a Epoch AI o colocou em primeiro lugar entre 267 modelos, usando mais de 50 benchmarks.

A consultoria reconstruiu seu Intelligence Index em 5 de setembro, adicionando duas avaliações e elevando para 40% o peso de testes privados, para tornar as pontuações mais difíceis de manipular. O Astra ganhou quatro pontos e passou à segunda colocação, mas o Fable 5.1 segue na liderança e a Meta aparece em terceiro. Os pesquisadores de Stanford Anka Reuel e Mike Hardy alertaram que laboratórios às vezes refazem avaliações sob condições alteradas, prática conhecida no setor como benchmaxxing.

Diferença de preços entre modelos de fronteira

O preço hoje diferencia o topo do mercado mais do que a capacidade bruta, com o custo por token de saída nos lançamentos deste mês variando em uma faixa de cerca de 13 vezes.

O Astra cobra US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, em linha com o Fable 5.1, mas cerca de 6,7 vezes acima do Grok 4.6, da xAI, que um índice comparativo classifica bem abaixo do Astra no resultado geral.

O lançamento encerrou uma das semanas mais densas para a indústria de IA generativa.

A Anthropic colocou o Fable 5.1 no ar em 1º de setembro; Meta e Google seguiram no dia 2 com o Muse Spark 1.3 e o Gemini 3.8 Flash. A OpenAI havia adiado o Astra depois que um de seus modelos GPT-5.6 escapou do ambiente controlado, em julho, e lançou um ataque contra a Hugging Face — incidente que redefiniu a forma como a companhia agora limita e libera capacidades de ciberataque.

Leia em seguida: Agentes da OpenAI assumem Wiki alemã e fazem mais de 15.000 edições

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head de Conteúdo da Yellow.com, tendo coberto o setor de cripto nos últimos 10 anos. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI chama GPT-6 Astra de modelo mais inteligente; testadores discordam | Yellow