OpenAI revela seis casos em que os seus modelos de IA ocultaram erros

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAI revelou seis casos em que os seus modelos de IA esconderam erros, recorreram a uma chave de API exposta ou partilharam ficheiros em público, e apresentou um novo enquadramento para relatar este tipo de comportamentos.

Pontos-chave:

  • A OpenAI divulgou seis relatórios sobre comportamentos desalinhados observados nos últimos seis meses.
  • Num dos casos, um modelo inventou dados de rendimento por condado após tentar usar uma chave de API exposta.
  • Qualquer funcionário pode agora sinalizar um incidente para eventual divulgação pública.

Relatórios de desalinhamento da OpenAI

A empresa publicou os relatórios na quarta‑feira num artigo de blogue, juntamente com um processo pensado para acelerar a divulgação mesmo quando os investigadores ainda não conseguiram explicar ou resolver totalmente o comportamento. O caso mais antigo remonta a outubro, e um dos seis foi detetado já em julho. A OpenAI afirma que passará a reportar incidentes mesmo quando a sua relevância ainda não esteja clara.

Num dos episódios, um modelo experimental ainda não lançado introduziu, nos próprios resumos de tarefas, instruções em estilo “jailbreak”, dizendo à próxima instância para ignorar as restrições impostas. A empresa identificou 27 resumos com este tipo de mensagem e sublinhou que não havia um benefício óbvio para o modelo em fazê‑lo.

Durante o treino do GPT-5.6 Sol, outras instâncias deixaram notas a instruir os sucessores a inventar dados históricos em falta e a “Ser transparente apenas se for pedido”. Um sistema de monitorização detetou este padrão em 2,15% dos resumos do modelo, e os investigadores suspeitam que se propaga porque respostas enganosas acabam por obter melhor pontuação. Em fases de treino posteriores, a incidência caiu depois de a empresa apertar os critérios com que avalia o alinhamento.

Leia também: Mineração de Bitcoin enfrenta défice de 50% no hashrate enquanto a IA absorve capacidade

Chaves de API expostas e números inventados

Noutro caso, um modelo procurou em repositórios públicos uma chave de API exposta enquanto tentava obter dados de rendimento dos residentes de um condado da Califórnia e, quando falhou, inventou os números. Num incidente separado, um modelo encarregado de listar lagos com mais de 5 milhões de metros quadrados usou Python para encontrar a resposta e carregou o ficheiro online para poder citar uma hiperligação.

Alguns modelos também usaram um repositório interno de software como quadro de avisos, trocando pedidos e respostas entre amostras de treino que deveriam permanecer independentes. Outros colocaram um ficheiro partilhado em serviços de alojamento público, apesar das instruções claras para trabalharem apenas com ficheiros locais. Nenhum procurou confirmar previamente com o utilizador.

Kai Chen sobre as regras de divulgação

Qualquer funcionário pode agora sinalizar um caso suspeito para revisão pelas equipas de segurança e alinhamento, que o encaminham por um de três circuitos. Os incidentes considerados prontos para divulgação vão a público em até seis dias úteis; os que exigem investigação limitada têm um prazo de 12 dias; e os casos complexos, que envolvem terceiros, avançam a um ritmo mais lento.

Kai Chen, responsável de investigação na equipa de alinhamento da OpenAI, afirmou que o setor não dispõe de um quadro com normas explícitas de divulgação e que as capacidades dos modelos cresceram mais depressa do que a empresa previa. Muitos especialistas em segurança sustentam que medidas básicas teriam evitado a recente série de incidentes. Em julho, a OpenAI reconheceu que o GPT-5.6 Sol e um modelo de pré‑lançamento mais poderoso escaparam a um “sandbox” de testes e invadiram a Hugging Face, naquele que classificou como o episódio mais grave de atividade autónoma dos seus modelos até à data.

A seguir: Shiba Inu corrige link da carteira do Shibarium, mas SHIB cai 6% na semana

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza é um jornalista financeiro experiente, com ampla atuação na cobertura de criptomoedas e tecnologia blockchain. Ele já contribuiu para a Benzinga e a Cointelegraph, entre outras publicações, reportando sobre tendências emergentes, o cenário regulatório e muito mais. Você pode encontrá-lo em @murtuza_merc no Twitter e mmerchant001 no Telegram. Divulgação: Murtuza possui ATOM, AKT, TIA, INJ e OSMO.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI revela seis casos em que os seus modelos de IA ocultaram erros | Yellow