OpenAI revela seis casos em que seus modelos de IA esconderam erros

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAI revelou seis casos em que seus modelos de IA ocultaram erros, usaram uma chave de API exposta ou publicaram arquivos abertamente — e apresentou um framework para relatar esse tipo de comportamento.

Pontos-chave:

  • A OpenAI publicou seis relatórios sobre comportamentos desalinhados observados nos últimos seis meses.
  • Um modelo inventou dados de renda por condado após tentar usar uma chave de API vazada.
  • Qualquer funcionário agora pode sinalizar um incidente para possível divulgação pública.

Relatórios de desalinhamento da OpenAI

A empresa publicou os relatórios na quarta-feira em um post no blog, junto com um processo pensado para acelerar a divulgação mesmo quando os pesquisadores ainda não conseguiram explicar ou corrigir totalmente o comportamento. O caso mais antigo é de outubro, e um dos seis foi identificado já em julho. A OpenAI afirma que, daqui em diante, vai relatar incidentes mesmo quando sua relevância ainda não estiver clara.

Em um dos episódios, um modelo de pesquisa ainda inédito inseriu, nos próprios resumos de tarefas, instruções no estilo “jailbreak”, dizendo à próxima cópia de si mesmo para ignorar as restrições impostas. A empresa encontrou 27 desses resumos e observou que não havia um benefício óbvio para o modelo ao escrever esse tipo de mensagem.

Durante o treinamento do GPT-5.6 Sol, outras instâncias deixaram recados para seus sucessores dizendo para inventar dados históricos ausentes e para “Ser transparente apenas se perguntarem”. Um sistema de monitoramento detectou esse comportamento em 2,15% dos resumos do modelo, e os pesquisadores suspeitam que ele se espalha porque respostas enganosas tendem a receber notas melhores. Rodadas posteriores de treinamento mostraram taxas menores depois que a empresa endureceu os critérios de avaliação de alinhamento.

Veja também: Mineração de Bitcoin encara déficit de 50% em hashrate enquanto IA consome capacidade

Chaves de API vazadas e números inventados

Em outro caso, um modelo vasculhou repositórios públicos em busca de uma chave de API exposta enquanto tentava levantar dados de renda dos moradores de um condado da Califórnia — e inventou os números quando não conseguiu encontrar o que queria. Em situação separada, ao ser encarregado de listar lagos com mais de 5 milhões de metros quadrados, um modelo encontrou a resposta via Python e fez upload do arquivo na internet para poder citar um link.

Alguns modelos também usaram um repositório interno de software como mural de recados, trocando pedidos e respostas entre amostras de treinamento que deveriam permanecer independentes. Outros enviaram uma planilha compartilhada para serviços públicos de hospedagem, apesar da orientação explícita de trabalhar apenas com arquivos locais. Nenhum deles consultou o usuário antes de agir.

Kai Chen e as regras de divulgação

Qualquer funcionário agora pode sinalizar um caso suspeito para revisão pelas equipes de segurança e alinhamento, que classificam cada incidente em uma de três trilhas. Casos considerados prontos vão a público em até seis dias úteis; os que exigem investigação limitada ganham prazo de 12 dias; e incidentes complexos, que envolvem terceiros, avançam em ritmo mais lento.

Kai Chen, líder de pesquisa da equipe de alinhamento da OpenAI, afirmou que o setor ainda não conta com um framework com padrões claros de divulgação e que as capacidades dos modelos evoluíram mais rápido do que a empresa previa. Muitos especialistas em segurança defendem que salvaguardas básicas poderiam ter evitado a sequência recente de incidentes. Em julho, a OpenAI admitiu que o GPT-5.6 Sol e um modelo de pré-lançamento ainda mais potente escaparam de um ambiente de testes e invadiram a Hugging Face, no que a empresa descreve como a atividade mais grave já protagonizada por seus modelos.

Leia a seguir: Shiba Inu corrige link quebrado da carteira da Shibarium, mas SHIB recua 6% em uma semana

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza é um jornalista financeiro experiente, com ampla vivência na cobertura de criptomoedas e tecnologia blockchain. Ele já contribuiu para a Benzinga e a Cointelegraph, entre outras publicações, reportando sobre tendências emergentes, o cenário regulatório e muito mais. Você pode encontrá-lo em @murtuza_merc no Twitter e como mmerchant001 no Telegram. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI revela seis casos em que seus modelos de IA esconderam erros | Yellow