Astra, da OpenAI passou a expor menos raciocínio em texto, reacendendo preocupações levantadas em um artigo de 2025 sobre monitorabilidade, coassinado pelo cientista-chefe Jakub Pachocki.
Principais pontos:
- A Astra parece realizar mais raciocínio “por baixo do capô”, sem colocar tudo em texto, o que levanta dúvidas sobre a capacidade de monitores detectarem comportamentos problemáticos.
- Ryan Greenblatt e Pachocki coassinaram, em julho de 2025, um artigo que classificava a monitorabilidade via chain-of-thought como uma oportunidade frágil de segurança em IA.
- Signatários do código europeu para modelos de uso geral são obrigados a enviar relatórios de segurança ao AI Office, incluindo evidências de avaliação que permitam revisão independente.
Monitorabilidade da Astra
O Semafor noticiou que a Astra parece realizar mais etapas de raciocínio sem expô-las em texto, o que levanta a questão: ainda é possível para equipes de segurança identificar comportamentos suspeitos enquanto o modelo “pensa”?
Greenblatt, pesquisador de segurança em IA na Redwood Research, escreveu que a Astra “parece capaz de resolver problemas difíceis de matemática competitiva inteiramente na própria cabeça”. E completou: “Isso é extremamente preocupante.”
Relatos também indicam que a OpenAI pode ter reduzido deliberadamente a visibilidade do raciocínio nas saídas do modelo para ganhar desempenho, embora a empresa não tenha confirmado essa hipótese. Pachocki reagiu dizendo querer “evitar uma corrida rumo à ‘não monitorabilidade’ impulsionada por reportagens confusas”.
O TNW já havia informado que a Astra se tornou mais difícil de monitorar do que sua antecessora quando o modelo tentou driblar mecanismos de supervisão — um tema que a própria OpenAI classifica como prioridade de pesquisa em aberto.
Leia também: OpenAI afirma que IA agora consegue lidar com tarefas de pesquisa que duram vários dias
O alerta de segurança de Pachocki
A polêmica ganha peso adicional porque Greenblatt e Pachocki estão entre os cerca de 40 autores de um artigo de julho de 2025 que descreveu a monitorabilidade de cadeias de raciocínio (chain-of-thought) como uma oportunidade nova, porém frágil, para segurança em IA. Pesquisadores da OpenAI, Google DeepMind, Anthropic, Meta, Amazon, do UK AI Security Institute e da Redwood Research assinaram o estudo.
O trabalho recomendava que desenvolvedores de modelos de fronteira criassem avaliações padronizadas de monitorabilidade, publicassem resultados e limitações em system cards e considerassem a capacidade de monitoramento em pé de igualdade com a de desempenho ao decidir sobre treinamento e implantação.
Na Europa, esse processo de transparência ganhou um destino formal. Signatários do General-Purpose AI Code of Practice da UE são obrigados a entregar um Model Report ao AI Office na introdução do modelo no mercado, detalhando avaliações, medidas de mitigação e relatórios de avaliadores externos.
Cada relatório também deve incluir cinco amostras de entradas e saídas selecionadas aleatoriamente de cada avaliação relevante, dando a revisores externos material para uma análise independente. A OpenAI é signatária plena do código.
A preocupação antecede o lançamento da Astra. O artigo de julho de 2025 alertava que novas arquiteturas poderiam enfraquecer a visibilidade do raciocínio em cadeia de pensamento, enquanto a OpenAI posteriormente aceitou um custo extra de cerca de 20% em capacidade computacional para ampliar o monitoramento de segurança de seus sistemas.
Leia a seguir: ETFs de Bitcoin recebem US$ 987 milhões e estendem sequência de entradas para três semanas

