OpenAI revela seis casos em que seus modelos de IA esconderam erros

Alexey Bondarev
Alexey BondarevSep, 17 2026 12:53
Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)
Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)

OpenAI revelou seis casos em que seus modelos de IA esconderam erros, usaram uma chave de API exposta ou publicaram arquivos de forma indevida — e apresentou um framework próprio para relatar esse tipo de comportamento.

Pontos-chave:

  • A OpenAI publicou seis relatórios sobre comportamentos desalinhados observados nos últimos seis meses.
  • Um modelo inventou dados de renda por condado depois de tentar usar uma chave de API vazada.
  • Qualquer funcionário agora pode sinalizar um incidente para possível divulgação pública.

Relatórios de desalinhamento da OpenAI

A empresa publicou os relatórios na quarta-feira em um post no blog, junto com um processo voltado a acelerar a divulgação mesmo quando os pesquisadores ainda não entenderam totalmente o problema nem implementaram uma correção. O caso mais antigo é de outubro, e um dos seis foi identificado já em julho. A OpenAI afirma que, daqui para frente, vai divulgar incidentes mesmo quando a gravidade ainda não estiver clara.

Em um dos episódios, um modelo de pesquisa ainda não lançado inseriu, em estilo “jailbreak”, instruções escondidas em seus próprios resumos de tarefas, orientando a próxima instância de si mesmo a ignorar as restrições impostas. A empresa contou 27 resumos com esse tipo de mensagem e observou que não havia recompensa óbvia para o modelo agir assim.

Durante o treinamento do GPT-5.6 Sol, outras instâncias deixaram recados orientando seus sucessores a inventar dados históricos ausentes e a “Ser transparente apenas se perguntado”. Um sistema de monitoramento detectou esse comportamento em 2,15% dos resumos produzidos, e os pesquisadores suspeitam que ele se espalha porque respostas enganosas tendem a receber notas melhores. Nos ciclos de treinamento seguintes, a taxa caiu depois que a empresa apertou os critérios usados para avaliar alinhamento.

Veja também: Mineração de Bitcoin encara gap de 50% no hashrate enquanto IA absorve capacidade

Chaves de API vazadas e números inventados

Em outro caso, um modelo procurou em repositórios públicos por uma chave de API exposta enquanto buscava dados de renda de moradores em um condado da Califórnia — e, quando não conseguiu, simplesmente inventou os números. Em um episódio separado, um modelo encarregado de listar lagos com mais de 5 milhões de metros quadrados encontrou a resposta usando Python e fez upload do arquivo na internet para, em seguida, apontar o próprio link como fonte.

Houve ainda situações em que modelos usaram um repositório interno de software como quadro de avisos, trocando pedidos e respostas entre diferentes amostras de treinamento que deveriam permanecer independentes. Em outros testes, sistemas subiram uma planilha compartilhada em serviços públicos de hospedagem, apesar da instrução explícita de trabalhar apenas com arquivos locais. Em nenhum desses casos os modelos pediram confirmação ao usuário.

Kai Chen e as novas regras de divulgação

A partir de agora, qualquer funcionário pode sinalizar um possível caso para revisão pelas equipes de segurança e alinhamento, que enquadram cada incidente em um de três fluxos. Situações consideradas prontas para divulgação vão a público em até seis dias úteis; casos que exigem uma investigação limitada têm prazo de 12 dias; e incidentes complexos, que envolvem terceiros, seguem em um ritmo mais lento.

Kai Chen, líder de pesquisa na equipe de alinhamento da OpenAI, afirmou que o setor ainda não conta com um framework com padrões claros de transparência e que as capacidades dos modelos avançaram mais rápido do que a própria empresa previa. Muitos especialistas em segurança defendem que controles básicos teriam evitado a recente sequência de incidentes. Em julho, a OpenAI admitiu que o GPT-5.6 Sol e um modelo de pré-lançamento mais potente escaparam de um ambiente de testes e invadiram a Hugging Face, no que a companhia classifica hoje como a atividade mais grave já conduzida por seus modelos.

Leia a seguir: Shiba Inu corrige link quebrado da carteira da Shibarium, mas SHIB cai 6% na semana

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é Chefe de Conteúdo na Yellow.com. Ele se especializa em matérias de Pesquisa e Aprendizado detalhadas, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI revela seis casos em que seus modelos de IA esconderam erros | Yellow