Astra, da OpenAI parece expor menos raciocínio em texto visível, reacendendo preocupações descritas num artigo de 2025 sobre “monitorability” coassinado pelo cientista‑chefe Jakub Pachocki.
Pontos-chave:
- O Astra aparenta realizar mais do seu raciocínio “por detrás do pano”, em vez de o explicitar em texto, o que levanta dúvidas sobre a capacidade de monitores detetarem comportamentos problemáticos.
- Ryan Greenblatt e Pachocki coassinaram, em julho de 2025, um paper que classificava a monitorização via chain-of-thought como uma oportunidade frágil para a segurança em IA.
- Os signatários do código europeu para modelos de uso geral são obrigados a apresentar relatórios de segurança de modelo ao AI Office, incluindo evidência de avaliação que permita revisão independente.
Monitorização do Astra
O Semafor noticiou que o Astra parece raciocinar cada vez mais sem revelar esse processo em texto visível, abrindo a pergunta: será que os monitores continuam a conseguir identificar comportamentos suspeitos enquanto o modelo “pensa”? Greenblatt, investigador de segurança em IA na Redwood Research, escreveu que o Astra “parece capaz de resolver problemas complexos de matemática de competição inteiramente na sua cabeça”. E acrescentou: “Isto é extremamente preocupante.”
Várias reportagens sugerem que a OpenAI poderá ter reduzido deliberadamente a transparência dos outputs do modelo para ganhar capacidades, embora a empresa não tenha confirmado essa tese. Pachocki reagiu dizendo que quer “evitar uma corrida rumo à não‑monitorização, desencadeada por reportagens confusas”.
O TNW já tinha revelado que o Astra se tornou mais difícil de monitorizar do que o seu antecessor quando o modelo tentava contornar mecanismos de supervisão – uma área que a OpenAI descreve como uma prioridade aberta de investigação.
Leia também: OpenAI diz que IA já consegue lidar com tarefas de investigação de vários dias
O alerta de segurança de Pachocki
O debate ganha peso porque Greenblatt e Pachocki estão entre os cerca de 40 autores de um paper publicado em julho de 2025 que apresentava a monitorização via chain-of-thought como uma oportunidade nova, mas frágil, para reforçar a segurança de sistemas de IA. No artigo participaram investigadores da OpenAI, Google DeepMind, Anthropic, Meta, Amazon, do UK AI Security Institute e da Redwood Research.
O estudo apelava a que os desenvolvedores na fronteira tecnológica criassem avaliações padronizadas de monitorabilidade, publicassem resultados e limitações em system cards e ponderassem a monitorização em paralelo com as capacidades quando tomassem decisões de treino ou de lançamento.
A Europa dá um enquadramento formal a esse processo de reporte. Os signatários do General-Purpose AI Code of Practice da UE têm de entregar um Model Report ao AI Office antes da entrada de cada modelo no mercado, detalhando avaliações, medidas de mitigação e relatórios de avaliadores externos.
Cada relatório deve ainda incluir cinco amostras selecionadas aleatoriamente de inputs e outputs de todas as avaliações relevantes, permitindo que revisores externos façam uma análise independente. A OpenAI é signatária plena do código.
A preocupação é anterior ao lançamento do Astra. O paper de julho de 2025 já alertava que novas arquiteturas poderiam enfraquecer o raciocínio em cadeia visível, enquanto a própria OpenAI aceitou mais tarde um aumento de cerca de 20% no custo computacional para reforçar os mecanismos de monitorização de segurança dos seus sistemas.
A seguir: ETFs de Bitcoin captam US$ 987 milhões e prolongam série de entradas para três semanas

