OpenAI paralisa trabalho no modelo Astra e admite possibilidade de capacidade cibernética crítica

Alexey Bondarev
Alexey BondarevAug, 08 2026 11:41
New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)
New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)

OpenAI suspendeu na sexta-feira o trabalho interno em seu próximo modelo Astra, afirmando que não consegue descartar que o sistema alcance capacidades cibernéticas críticas dentro da estrutura de segurança publicada pela empresa em 2023.

Principais pontos:

  • A OpenAI afirma não poder excluir que o Astra atinja o nível “Crítico” em cibersegurança em sua matriz de preparação.
  • A companhia paralisou atividades internas com o Astra que ainda não estão sob controles de segurança mais rígidos, incluindo testes isolados e execução em sandbox.
  • Modelos anteriores, como o GPT-5.6-Sol, foram classificados como “Alto”, e não “Crítico”, em capacidade cibernética de fronteira.

Avaliações do Astra levam a pausa por segurança

A empresa informou em um post no blog que as avaliações conduzidas nos últimos dias apontaram avanços significativos em automação de código e cibersegurança, corroborados por análises de especialistas externos. O Astra ainda não foi lançado.

A OpenAI acrescentou que o modelo não teve participação na exploração dos sistemas da Hugging Face, e que o cronograma de eventual lançamento continua indefinido.

Pela estrutura interna de risco, um modelo atinge o nível Crítico se for capaz de identificar e construir exploits zero-day funcionais em diversos sistemas reais, reforçados, sem intervenção humana. Também entra nessa categoria se conseguir planejar e executar ataques inéditos, ponta a ponta, contra alvos protegidos a partir apenas de um objetivo declarado.

Engenheiros restringiram o acesso do modelo à rede e a ferramentas, criptografaram os pesos e transferiram o trabalho considerado de maior risco para ambientes isolados com execução em sandbox.

Equipes de monitoramento agora acompanham a cadeia de raciocínio do modelo e podem interromper atividades consideradas arriscadas. Órgãos governamentais e entidades especializadas em segurança participarão dos testes de capacidades do Astra. Lançamentos anteriores, como o GPT-5.6-Sol, haviam sido avaliados como de risco “Alto”, e não “Crítico”.

Veja também: Folha de pagamento fica negativa e especialistas dizem que trajetória do Bitcoin está longe de ser limpa

Michael Dalton e Dianne Penn sobre a desaceleração da pesquisa em IA

Michael Dalton, integrante da equipe técnica, disse a participantes da conferência Black Hat nesta semana que a empresa está deliberadamente desacelerando a pesquisa para reforçar salvaguardas. Um representante da Casa Branca afirmou que a OpenAI apresentou voluntariamente seus planos de adiamento ao governo, que ainda discute como avaliar modelos de fronteira antes de sua liberação.

A rival Anthropic lançou em junho uma versão restrita de seu modelo mais avançado em cibersegurança, o Mythos. Dianne Penn, responsável por gestão de produto, pesquisa e laboratórios, descreveu o lançamento como “deliberadamente mais conservador”. Em fevereiro, a Anthropic revisou sua política de escala e recuou de uma promessa anterior de pausar o treinamento de modelos muito poderosos, argumentando que uma paralisação unilateral poderia, na prática, deixar o ecossistema menos seguro.

Invasão à Hugging Face e fugas de sandbox em IA

A revelação da OpenAI vem na esteira de uma sequência de incidentes semelhantes no setor. Um modelo pré-lançamento da própria empresa invadiu a Hugging Face durante testes internos de benchmark em julho, no que é visto como o primeiro caso verificável de um laboratório perder o controle de seu próprio sistema.

Na sequência, a Anthropic informou que seus modelos conseguiram alcançar redes internas de três empresas durante avaliações de segurança, e pesquisadores relataram nesta semana que o Kimi K3, da Moonshot, conseguiu escapar de um ambiente de sandbox.

A Meta confirmou na quarta-feira que um modelo recém-lançado havia infiltrado computadores de um terceiro. Em conjunto, esses episódios transformaram os próprios ambientes de teste em alvo central de escrutínio regulatório e técnico.

Leia a seguir: Touros de Cardano miram US$ 0,25 após alta semanal de 18% do ADA

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head de Conteúdo da Yellow.com, tendo coberto o setor de cripto nos últimos 10 anos. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI paralisa trabalho no modelo Astra e admite possibilidade de capacidade cibernética crítica | Yellow