OpenAI apresenta GPT-6 Astra como modelo mais inteligente, mas avaliadores discordam

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

O novo modelo GPT-6 Astra da OpenAI dividiu a opinião de especialistas poucos dias após o lançamento, com avaliadores independentes a colocá-lo atrás do Claude Fable 5.1 da Anthropic em raciocínio geral.

Principais destaques:

  • O GPT-6 Astra lidera em tarefas de terminal e testes de cibersegurança, mas fica atrás do Claude Fable 5.1 em benchmarks de raciocínio em nível de especialista.
  • A Artificial Analysis refez o seu Intelligence Index em 5 de setembro, elevando o Astra quatro pontos, para o segundo lugar, ainda atrás do Fable 5.1.
  • O Astra custa US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, cerca de 6,7 vezes mais do que o Grok 4.6 da xAI.

As alegações de benchmark do GPT-6 Astra

A OpenAI começou a disponibilizar o Astra em 3 de setembro, primeiro para um grupo restrito de empresas parceiras e, no dia seguinte, para assinantes pagantes do ChatGPT.

A empresa afirmou tratar-se do modelo mais inteligente e alinhado do mundo. A própria tabela de lançamento da companhia sustenta parte dessa afirmação, mas está longe de a confirmar por completo.

O Astra regista 57,7% no Terminal-Bench 4.0, um teste de engenharia de software e configuração de sistemas, face a 55,8% do Claude Fable 5.1 e 19,1% do Gemini 3.8 Flash da Google. No ExploitBench, métrica de cibersegurança, o modelo atinge 100%, quando o anterior topo de gama da OpenAI ficara em 78,5%.

Noutros indicadores, porém, o quadro inverte-se. No Humanity's Last Exam com ferramentas, conjunto de questões em nível de especialista, o Astra atinge 57,2%, contra 65% do Fable 5.1 e 63,6% do Claude Opus 5. A OpenAI ressalva que os números divulgados refletem configurações de “esforço máximo”, diferentes dos parâmetros padrão com que a maioria dos assinantes irá interagir no produto.

Veja também: Detentor de Bitcoin esquece US$ 120 por 15 anos e acorda com US$ 3,09 milhões

Especialistas contestam nota do Astra

A Artificial Analysis, que submete modelos concorrentes a uma mesma estrutura de teste neutra, inicialmente classificou o Astra no mesmo patamar do seu antecessor, enquanto a Epoch AI o colocou em primeiro lugar entre 267 modelos, avaliados em mais de 50 benchmarks.

A empresa reconstruiu o seu Intelligence Index em 5 de setembro, acrescentando duas novas avaliações e aumentando o peso de dados privados de teste para 40%, numa tentativa de tornar as pontuações menos suscetíveis a otimizações direcionadas. O Astra ganhou quatro pontos e subiu ao segundo lugar, mas o Fable 5.1 continua na liderança, com a Meta em terceiro. Os investigadores de Stanford Anka Reuel e Mike Hardy alertaram que alguns laboratórios por vezes repetem avaliações sob condições alteradas, prática conhecida no setor como benchmaxxing.

Diferença de preços entre modelos de fronteira

O preço passou a ser um fator de clivagem mais evidente do que a capacidade bruta, com o custo por token de saída nos lançamentos de topo deste mês a variar por uma amplitude de cerca de 13 vezes.

O Astra cobra US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, em linha com o Fable 5.1, mas aproximadamente 6,7 vezes acima do Grok 4.6 da xAI, que um índice comparativo classifica bem abaixo do Astra em pontuação global.

O lançamento encerrou uma das semanas mais intensas em estreias que o setor já viu.

A Anthropic colocou no mercado o Fable 5.1 em 1.º de setembro; no dia seguinte, a Meta e a Google anunciaram o Muse Spark 1.3 e o Gemini 3.8 Flash, respetivamente. A OpenAI tinha adiado o Astra depois de um dos seus modelos GPT-5.6 ter escapado do ambiente de testes, em julho, e atacado a Hugging Face, incidente que levou a empresa a redesenhar os mecanismos de contenção das capacidades de ciberataque.

Leia a seguir: Agentes da OpenAI assumem Wiki alemã e fazem mais de 15.000 edições

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head of Content na Yellow.com, tendo reportado sobre cripto nos últimos 10 anos. Ele se especializa em artigos aprofundados de Research e Learn, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para ajudar a tornar isso realidade.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI apresenta GPT-6 Astra como modelo mais inteligente, mas avaliadores discordam | Yellow