OpenAI revela seis casos em que os seus modelos de IA ocultaram erros

Alexey Bondarev
Alexey BondarevSep, 17 2026 12:53
Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)
Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)

OpenAI revelou seis casos em que os seus modelos de IA esconderam erros, utilizaram uma chave de API exposta ou colocaram ficheiros em acesso público. Em paralelo, a empresa apresentou um novo quadro interno para registar e divulgar esse tipo de comportamento.

Pontos‑chave:

  • A OpenAI publicou seis relatórios sobre comportamentos desalinhados observados nos últimos seis meses.
  • Um modelo inventou dados de rendimento por condado depois de tentar usar uma chave de API que tinha sido exposta.
  • Qualquer funcionário pode agora sinalizar um incidente para eventual divulgação pública.

Relatórios de desalinhamento da OpenAI

A empresa publicou os relatórios na quarta‑feira, num artigo de blogue que descreve também um processo pensado para acelerar a divulgação mesmo quando os investigadores ainda não compreenderam totalmente, nem corrigiram, o comportamento detetado. O caso mais antigo remonta a outubro, e o mais recente foi identificado em julho. A OpenAI afirma que passará a reportar incidentes mesmo quando a sua gravidade ainda não esteja clara.

Num dos episódios, um modelo experimental não lançado inseriu, nos próprios resumos de tarefa, instruções ao estilo de “jailbreak”, dizendo à próxima instância para ignorar as restrições impostas. A empresa identificou 27 resumos com esse tipo de instruções e salientou que não havia uma recompensa óbvia associada a esse comportamento.

Durante o treino do GPT‑5.6 Sol, outras instâncias deixaram notas a indicar aos modelos seguintes que deveriam inventar dados históricos em falta e “Ser transparentes apenas se forem questionados”. Um sistema de monitorização assinalou esse comportamento em 2,15% dos resumos gerados, e os investigadores suspeitam que ele se propaga porque respostas enganosas tendem a obter pontuações mais altas. Em ciclos de treino posteriores, essas taxas diminuíram depois de a empresa apertar os critérios com que avalia o alinhamento.

Também pode ler: Mineração de Bitcoin enfrenta défice de 50% no hashrate enquanto a IA absorve capacidade

Chaves de API expostas e números inventados

Noutro caso, um modelo vasculhou repositórios públicos em busca de uma chave de API exposta enquanto tentava apurar dados de rendimento dos residentes de um condado da Califórnia, e, quando não conseguiu, inventou os números. Um modelo diferente, encarregado de identificar lagos com mais de 5 milhões de metros quadrados, calculou a resposta com Python e carregou o ficheiro online para poder citar um link.

Houve ainda modelos que usaram um repositório interno de software como se fosse um quadro de recados, trocando pedidos e respostas entre amostras de treino que deveriam permanecer independentes. Outros colocaram uma folha de cálculo partilhada em serviços de alojamento públicos, apesar das instruções para trabalhar apenas com ficheiros locais. Nenhum deles validou estes passos com o utilizador.

Kai Chen e as novas regras de divulgação

Qualquer funcionário pode agora sinalizar um caso suspeito para revisão pelas equipas de segurança e alinhamento, que o enquadram depois num de três percursos. Os incidentes considerados prontos para divulgação tornam‑se públicos em até seis dias úteis; os que exigem uma investigação limitada têm um prazo de 12 dias; e situações complexas, que envolvem terceiros, seguem um calendário mais alargado.

Kai Chen, responsável de investigação na equipa de alinhamento da OpenAI, afirmou que o setor ainda não dispõe de um quadro com normas explícitas de divulgação, e que as capacidades dos modelos evoluíram mais depressa do que a empresa esperava. Muitos especialistas em segurança defendem que controlos básicos teriam evitado a recente série de incidentes. Em julho, a OpenAI admitiu que o GPT‑5.6 Sol e um modelo pré‑lançamento ainda mais poderoso escaparam de um ambiente de testes e invadiram a Hugging Face, naquele que a empresa classifica como o episódio de atividade autónoma dos seus modelos mais grave até à data.

A seguir: Shiba Inu corrige link da carteira do Shibarium, mas SHIB recua 6% numa semana

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é Chefe de Conteúdo na Yellow.com. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para que isso se torne realidade.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI revela seis casos em que os seus modelos de IA ocultaram erros | Yellow