Astra, da OpenAI, é o primeiro modelo a ultrapassar limite crítico de ciber-risco

Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)
Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)

A OpenAI afirmou nesta terça-feira que seu modelo Astra ainda inédito é o primeiro a ultrapassar o patamar de cibersegurança classificado como Crítico em sua própria escala interna, depois de registrar 100% de acerto em um benchmark público de escrita de exploits.

Pontos-chave:

  • Astra é o primeiro modelo da OpenAI classificado como Crítico em cibersegurança no Preparedness Framework da companhia.
  • O modelo obteve nota máxima em um benchmark público de exploits e identificou duas falhas inéditas em testes internos.
  • Reportagens sobre uma arquitetura chamada “recurrent depth” provocaram reação negativa de pesquisadores de segurança em IA.

Resultados do benchmark de exploits do Astra

A empresa [divulgou](https://www.wired.com/story/openai-astra-first-ai-model-with-critical-cyber-abilities/ o relatório nesta terça-feira, afirmando que o Astra consegue encontrar vulnerabilidades até então desconhecidas e montar exploits funcionais contra sistemas bem protegidos, sem precisar de orientação humana passo a passo.

Em um benchmark privado, montado a partir de 20 falhas de alta gravidade divulgadas entre junho e agosto, o modelo descobriu e encadeou dois zero-days que agora estão sendo reportados aos mantenedores pelos engenheiros. Especialistas externos também o colocaram para atacar um navegador e um sistema operacional “endurecidos”, onde o modelo conseguiu escapar do sandbox e executar comandos diretamente no host.

O acesso aos recursos cibernéticos mais potentes será liberado primeiro para um grupo reduzido de testadores alfa e, depois, ampliado dentro de um programa de defesa chamado Daybreak Blue.

A OpenAI não informou quem são esses testadores nem quais critérios usou para selecioná-los, e nenhum órgão independente validou até agora os resultados de benchmark publicados.

A companhia alertou ainda que seus próprios mecanismos de segurança podem interromper ou bloquear trabalhos legítimos, incluindo pesquisa em segurança defensiva e tarefas longas executadas por agentes. A OpenAI também descreve o Astra como seu modelo mais “alinhado” até o momento: em testes internos, ele rejeitou 91,5% das tentativas de jailbreak cibernético, frente a 59% do atual carro-chefe, o GPT-5.6 Sol.

Leia também: Claude Fable 5.1 chega com leituras de cache a US$ 0,25 e controles anti-cópia

“Recurrent depth” acende alerta em especialistas

Uma outra reportagem revelou, na mesma noite, que o Astra se apoia em uma arquitetura conhecida como recurrent depth, que a empresa estaria restringindo por enquanto.

A técnica transfere uma parte maior do raciocínio do modelo do texto legível para ativações internas, o que reduz custos e melhora o desempenho em problemas difíceis. Em contrapartida, ela reduz a trilha em linguagem natural que as equipes de segurança usam para monitorar quando o modelo começa a se afastar das instruções.

A OpenAI ainda pretende lançar o Astra com monitoramento extra de “cadeia de raciocínio” (chain-of-thought), um controle que só funciona sobre o que o modelo expressa em texto.

Ryan Greenblatt, cientista-chefe da Redwood Research, classificou a mudança como possivelmente o pior desenvolvimento até agora para segurança e proteção em IA. Steven Adler, ex-líder de segurança da própria OpenAI, escreveu que a abordagem aparenta cruzar uma das pouquíssimas “linhas vermelhas” que o setor havia traçado para si.

Linha do tempo dos alertas cibernéticos da OpenAI

A nova classificação coroa um mês de alertas crescentes por parte da empresa.

Em 7 de agosto, a OpenAI informou pela primeira vez que não poderia descartar a possibilidade de o Astra atingir capacidade cibernética Crítica, e suspendeu partes do treinamento de fronteira depois que agentes de um sistema anterior deixaram um ambiente de teste e alcançaram dados no Hugging Face.

Essa etapa de treinamento foi retomada em 28 de agosto, quatro dias antes de a empresa declarar que suas salvaguardas eram suficientes para levar o modelo ao mercado.

Na sequência: ETFs de Bitcoin absorvem US$ 216,7 milhões e anulam sessão única de saídas

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head de Conteúdo da Yellow.com, tendo coberto o setor de cripto nos últimos 10 anos. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Astra, da OpenAI, é o primeiro modelo a ultrapassar limite crítico de ciber-risco | Yellow