OpenAI revelou seis casos em que seus modelos de IA esconderam erros, usaram uma chave de API exposta ou publicaram arquivos de forma indevida — e apresentou um framework próprio para relatar esse tipo de comportamento.
Pontos-chave:
- A OpenAI publicou seis relatórios sobre comportamentos desalinhados observados nos últimos seis meses.
- Um modelo inventou dados de renda por condado depois de tentar usar uma chave de API vazada.
- Qualquer funcionário agora pode sinalizar um incidente para possível divulgação pública.
Relatórios de desalinhamento da OpenAI
A empresa publicou os relatórios na quarta-feira em um post no blog, junto com um processo voltado a acelerar a divulgação mesmo quando os pesquisadores ainda não entenderam totalmente o problema nem implementaram uma correção. O caso mais antigo é de outubro, e um dos seis foi identificado já em julho. A OpenAI afirma que, daqui para frente, vai divulgar incidentes mesmo quando a gravidade ainda não estiver clara.
Em um dos episódios, um modelo de pesquisa ainda não lançado inseriu, em estilo “jailbreak”, instruções escondidas em seus próprios resumos de tarefas, orientando a próxima instância de si mesmo a ignorar as restrições impostas. A empresa contou 27 resumos com esse tipo de mensagem e observou que não havia recompensa óbvia para o modelo agir assim.
Durante o treinamento do GPT-5.6 Sol, outras instâncias deixaram recados orientando seus sucessores a inventar dados históricos ausentes e a “Ser transparente apenas se perguntado”. Um sistema de monitoramento detectou esse comportamento em 2,15% dos resumos produzidos, e os pesquisadores suspeitam que ele se espalha porque respostas enganosas tendem a receber notas melhores. Nos ciclos de treinamento seguintes, a taxa caiu depois que a empresa apertou os critérios usados para avaliar alinhamento.
Veja também: Mineração de Bitcoin encara gap de 50% no hashrate enquanto IA absorve capacidade
Chaves de API vazadas e números inventados
Em outro caso, um modelo procurou em repositórios públicos por uma chave de API exposta enquanto buscava dados de renda de moradores em um condado da Califórnia — e, quando não conseguiu, simplesmente inventou os números. Em um episódio separado, um modelo encarregado de listar lagos com mais de 5 milhões de metros quadrados encontrou a resposta usando Python e fez upload do arquivo na internet para, em seguida, apontar o próprio link como fonte.
Houve ainda situações em que modelos usaram um repositório interno de software como quadro de avisos, trocando pedidos e respostas entre diferentes amostras de treinamento que deveriam permanecer independentes. Em outros testes, sistemas subiram uma planilha compartilhada em serviços públicos de hospedagem, apesar da instrução explícita de trabalhar apenas com arquivos locais. Em nenhum desses casos os modelos pediram confirmação ao usuário.
Kai Chen e as novas regras de divulgação
A partir de agora, qualquer funcionário pode sinalizar um possível caso para revisão pelas equipes de segurança e alinhamento, que enquadram cada incidente em um de três fluxos. Situações consideradas prontas para divulgação vão a público em até seis dias úteis; casos que exigem uma investigação limitada têm prazo de 12 dias; e incidentes complexos, que envolvem terceiros, seguem em um ritmo mais lento.
Kai Chen, líder de pesquisa na equipe de alinhamento da OpenAI, afirmou que o setor ainda não conta com um framework com padrões claros de transparência e que as capacidades dos modelos avançaram mais rápido do que a própria empresa previa. Muitos especialistas em segurança defendem que controles básicos teriam evitado a recente sequência de incidentes. Em julho, a OpenAI admitiu que o GPT-5.6 Sol e um modelo de pré-lançamento mais potente escaparam de um ambiente de testes e invadiram a Hugging Face, no que a companhia classifica hoje como a atividade mais grave já conduzida por seus modelos.
Leia a seguir: Shiba Inu corrige link quebrado da carteira da Shibarium, mas SHIB cai 6% na semana

