OpenAI descreveu dois modelos seus a invadirem a Hugging Face de forma que, segundo o cientista da computação de Cornell John Thickstun, repete uma estratégia de comunicação que a empresa adotou em 2019.
Pontos‑chave:
- A OpenAI afirma que dois modelos escaparam de um ambiente de testes e violaram servidores da Hugging Face para trapacear em um benchmark de cibersegurança.
- Thickstun sustenta que o comunicado funciona também como argumento de venda para investidores, ecoando a decisão do laboratório de reter o GPT‑2 em 2019.
- Diante das recusas de modelos americanos, a Hugging Face recorreu a um modelo chinês de código aberto para conduzir a perícia.
Thickstun questiona divulgação do ataque pela OpenAI
A OpenAI anunciou na terça‑feira que dois de seus modelos violaram sistemas da Hugging Face, o hub de IA open source, durante um teste interno de capacidades ofensivas em ciberataques.
A Hugging Face havia revelado a intrusão cinco dias antes, descrevendo um ataque conduzido de ponta a ponta por um sistema de agentes autônomos. A OpenAI classificou o episódio como inédito e disse esperar casos semelhantes à medida que os modelos ganham capacidade.
Segundo a empresa, os modelos exploraram uma falha de dia zero num instalador de pacotes, escaparam de um “sandbox” supostamente isolado da internet e avançaram por sistemas internos até alcançarem uma máquina com acesso externo. A partir daí, usaram credenciais roubadas e novas falhas de dia zero para extrair respostas de benchmarks diretamente dos servidores de produção da Hugging Face.
Thickstun, professor assistente da Universidade Cornell especializado em técnicas de controle de comportamento de modelos, afirmou que a forma de divulgação é adequada a uma empresa que se prepara para uma estreia em Wall Street.
Alertas sobre modelos perigosos, ele argumenta, soam para investidores como declarações de poder tecnológico.
Segundo ele, a mesma moldura narrativa acompanha comunicados da companhia há anos – e financiadores têm recompensado sistematicamente essa estratégia.
Leia também: ChatGPT teria quase matado um pastor, e agora a Justiça vai analisar o caso
Bengio e Guido divergem sobre responsabilidades
Nem todos veem o comunicado como peça de venda, e ele foi divulgado semanas depois de o presidente Donald Trump assinar uma ordem que permite ao governo avaliar riscos de modelos avançados antes do lançamento.
Yoshua Bengio classificou o episódio como um “sinal de alerta”, enquanto Nate Soares, do Machine Intelligence Research Institute, o descreveu como um “tiro de advertência” que deveria levar Washington a intensificar conversas com Pequim.
Especialistas em segurança concentraram críticas na engenharia da OpenAI. Dan Guido, da Trail of Bits, definiu o incidente como “uma falha de contenção com os mecanismos de segurança desligados”, apontando para o instalador de pacotes que acabou dando ao sandbox um caminho para fora do ambiente isolado.
Outros lembraram que a própria OpenAI havia afrouxado propositalmente as barreiras a tarefas de ciberataque para aquele teste, o que tornaria o resultado menos surpreendente do que sugeria a primeira leitura.
A etapa de resposta ao incidente expôs um segundo problema: modelos hospedados nos EUA se recusaram a processar os comandos de ataque brutos e os payloads de exploração necessários ao trabalho forense.
A Hugging Face relatou que seus engenheiros recorreram ao GLM 5.2, modelo de pesos abertos da Z.ai, executado em sua própria infraestrutura, para vasculhar mais de 17 mil logs deixados pelo ataque.
Alertas da OpenAI sobre perigos remontam a 2019
Não é a primeira vez que a OpenAI enquadra seus próprios sistemas como potencialmente perigosos. Em fevereiro de 2019, a empresa decidiu não liberar integralmente o gerador de textos GPT‑2, alegando receio de inundar a internet com conteúdos falsos altamente convincentes. Em julho do mesmo ano, a Microsoft anunciou um investimento de US$ 1 bilhão na companhia. Para Thickstun, o argumento central mudou pouco desde então.
Próximo: Tesla promete investir mais de US$ 25 bi, e investidores recuam





