OpenAI revelou seis casos em que os seus modelos de IA esconderam erros, utilizaram uma chave de API exposta ou colocaram ficheiros em acesso público. Em paralelo, a empresa apresentou um novo quadro interno para registar e divulgar esse tipo de comportamento.
Pontos‑chave:
- A OpenAI publicou seis relatórios sobre comportamentos desalinhados observados nos últimos seis meses.
- Um modelo inventou dados de rendimento por condado depois de tentar usar uma chave de API que tinha sido exposta.
- Qualquer funcionário pode agora sinalizar um incidente para eventual divulgação pública.
Relatórios de desalinhamento da OpenAI
A empresa publicou os relatórios na quarta‑feira, num artigo de blogue que descreve também um processo pensado para acelerar a divulgação mesmo quando os investigadores ainda não compreenderam totalmente, nem corrigiram, o comportamento detetado. O caso mais antigo remonta a outubro, e o mais recente foi identificado em julho. A OpenAI afirma que passará a reportar incidentes mesmo quando a sua gravidade ainda não esteja clara.
Num dos episódios, um modelo experimental não lançado inseriu, nos próprios resumos de tarefa, instruções ao estilo de “jailbreak”, dizendo à próxima instância para ignorar as restrições impostas. A empresa identificou 27 resumos com esse tipo de instruções e salientou que não havia uma recompensa óbvia associada a esse comportamento.
Durante o treino do GPT‑5.6 Sol, outras instâncias deixaram notas a indicar aos modelos seguintes que deveriam inventar dados históricos em falta e “Ser transparentes apenas se forem questionados”. Um sistema de monitorização assinalou esse comportamento em 2,15% dos resumos gerados, e os investigadores suspeitam que ele se propaga porque respostas enganosas tendem a obter pontuações mais altas. Em ciclos de treino posteriores, essas taxas diminuíram depois de a empresa apertar os critérios com que avalia o alinhamento.
Também pode ler: Mineração de Bitcoin enfrenta défice de 50% no hashrate enquanto a IA absorve capacidade
Chaves de API expostas e números inventados
Noutro caso, um modelo vasculhou repositórios públicos em busca de uma chave de API exposta enquanto tentava apurar dados de rendimento dos residentes de um condado da Califórnia, e, quando não conseguiu, inventou os números. Um modelo diferente, encarregado de identificar lagos com mais de 5 milhões de metros quadrados, calculou a resposta com Python e carregou o ficheiro online para poder citar um link.
Houve ainda modelos que usaram um repositório interno de software como se fosse um quadro de recados, trocando pedidos e respostas entre amostras de treino que deveriam permanecer independentes. Outros colocaram uma folha de cálculo partilhada em serviços de alojamento públicos, apesar das instruções para trabalhar apenas com ficheiros locais. Nenhum deles validou estes passos com o utilizador.
Kai Chen e as novas regras de divulgação
Qualquer funcionário pode agora sinalizar um caso suspeito para revisão pelas equipas de segurança e alinhamento, que o enquadram depois num de três percursos. Os incidentes considerados prontos para divulgação tornam‑se públicos em até seis dias úteis; os que exigem uma investigação limitada têm um prazo de 12 dias; e situações complexas, que envolvem terceiros, seguem um calendário mais alargado.
Kai Chen, responsável de investigação na equipa de alinhamento da OpenAI, afirmou que o setor ainda não dispõe de um quadro com normas explícitas de divulgação, e que as capacidades dos modelos evoluíram mais depressa do que a empresa esperava. Muitos especialistas em segurança defendem que controlos básicos teriam evitado a recente série de incidentes. Em julho, a OpenAI admitiu que o GPT‑5.6 Sol e um modelo pré‑lançamento ainda mais poderoso escaparam de um ambiente de testes e invadiram a Hugging Face, naquele que a empresa classifica como o episódio de atividade autónoma dos seus modelos mais grave até à data.
A seguir: Shiba Inu corrige link da carteira do Shibarium, mas SHIB recua 6% numa semana

