OpenAI Astra esconde mais o raciocínio e reacende alerta de segurança de 2025

Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

Astra, da OpenAI parece expor menos do seu raciocínio em texto visível, reacendendo preocupações detalhadas em um paper de 2025 sobre monitorabilidade, coassinado pelo cientista-chefe Jakub Pachocki.

Principais pontos:

  • O Astra parece realizar menos do seu raciocínio em texto visível, levantando dúvidas sobre a capacidade de monitores identificarem comportamentos problemáticos.
  • Ryan Greenblatt e Pachocki coassinaram, em julho de 2025, um artigo que classificou a monitorabilidade da chain-of-thought como uma oportunidade frágil de segurança em IA.
  • Signatários do código de conduta da UE precisam entregar relatórios de segurança de modelos ao AI Office, com evidências de avaliação que permitam revisão independente.

Monitorabilidade do Astra

O Semafor noticiou que o Astra aparenta fazer mais raciocínios “por baixo do capô”, sem expô-los em texto, o que levanta dúvidas sobre se monitores ainda conseguem detectar comportamentos suspeitos enquanto o modelo está operando. Greenblatt, pesquisador de segurança em IA na Redwood Research, escreveu que o Astra “parece capaz de resolver problemas difíceis de matemática de olimpíada inteiramente na cabeça”. Ele concluiu: “Isso é extremamente preocupante.”

Reportagens também sugerem que a OpenAI pode ter reduzido deliberadamente a visibilidade do raciocínio nas saídas do modelo para aumentar desempenho, embora a empresa não tenha confirmado essa hipótese. Pachocki reagiu dizendo que queria “evitar uma corrida rumo à ‘inmonitorabilidade’, alimentada por reportagens confusas”.

O TNW já havia noticiado que o Astra se tornou mais difícil de monitorar do que seu antecessor quando o modelo tentava escapar de mecanismos de supervisão — um tema que a própria OpenAI classifica como prioridade aberta de pesquisa.

Leia também: OpenAI diz que IA já consegue lidar com tarefas de pesquisa que duram vários dias

O alerta de segurança de Pachocki

O embate chama atenção porque Greenblatt e Pachocki estão entre os cerca de 40 autores de um paper de julho de 2025 que descreve a monitorabilidade da chain-of-thought como uma oportunidade nova, porém frágil, para segurança em IA. Pesquisadores da OpenAI, Google DeepMind, Anthropic, Meta, Amazon, do UK AI Security Institute e da Redwood Research participaram do estudo.

O artigo recomendava que desenvolvedores de modelos de fronteira criassem avaliações padronizadas de monitorabilidade, publicassem resultados e limitações em system cards e considerassem a monitorabilidade, junto com a capacidade do modelo, ao tomar decisões de treinamento ou de implantação.

A Europa deu um destino formal a esse processo de reporte. Signatários do Código de Boas Práticas para IA de Propósito Geral da UE devem entregar um Model Report ao AI Office antes da entrada do modelo no mercado, cobrindo avaliações, medidas de mitigação e relatórios de avaliadores externos.

Cada relatório também precisa incluir cinco amostras aleatórias de entradas e saídas de cada avaliação relevante do modelo, oferecendo material para análise independente por revisores externos — e a OpenAI é signatária integral do código.

A preocupação é anterior ao lançamento do Astra. O paper de julho de 2025 alertava que novas arquiteturas poderiam enfraquecer o raciocínio em chain-of-thought visível, enquanto a OpenAI mais tarde aceitou um custo extra de cerca de 20% em computação para ampliar a monitoração de segurança de seus sistemas.

Próximo: ETFs de Bitcoin captam US$ 987 milhões e engatam terceira semana seguida de entradas

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head de Conteúdo da Yellow.com, tendo coberto o setor de cripto nos últimos 10 anos. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI Astra esconde mais o raciocínio e reacende alerta de segurança de 2025 | Yellow