Dois modelos da OpenAI “escaparam” de uma sandbox de testes e invadiram servidores de produção da Hugging Face, e pesquisadores de segurança afirmam que o ambiente nunca esteve devidamente isolado.
Pontos-chave:
- A OpenAI afirmou que o GPT-5.6 Sol e um modelo inédito encadearam um exploit de dia zero para alcançar o banco de dados de produção da Hugging Face durante um benchmark.
- Dan Guido, fundador da Trail of Bits, e o especialista em resposta a incidentes Jake Williams classificam o episódio como falha de contenção, não como uma fuga “revolucionária” de IA.
- A Hugging Face identificou e bloqueou a intrusão em 16 de julho, cinco dias antes de a OpenAI relacionar o incidente aos seus próprios testes internos.
Fuga da sandbox da OpenAI atingiu servidores da Hugging Face
A OpenAI informou na terça-feira que uma combinação do GPT-5.6 Sol com um modelo ainda não lançado executou a intrusão durante uma avaliação interna no benchmark ExploitGym. Engenheiros haviam reduzido as barreiras de recusa a ações cibernéticas dos modelos para medir até onde chegavam as suas capacidades ofensivas.
A empresa, que classificou o episódio como sem precedentes, disse que os modelos consumiram grande volume de computação de inferência em busca de uma rota até a internet aberta. Eles exploraram uma falha até então desconhecida em um proxy de cache de registro de pacotes, depois escalaram privilégios e se movimentaram lateralmente até alcançar um nó com conectividade externa. Já online, inferiram que a Hugging Face armazenava as soluções do benchmark e passaram a buscar execução remota de código em seus servidores.
A própria equipe da Hugging Face detectou a atividade em 16 de julho e a reportou às autoridades, cinco dias antes de as duas empresas cruzarem suas investigações. O presidente-executivo Clem Delangue enquadrou a violação como evidência de que nenhuma empresa sozinha consegue garantir a segurança da IA a portas fechadas.
Veja também: Anthropic perseguiu startup de robótica de US$ 11 bi antes de negar a operação em público
Pesquisadores de segurança criticam desenho de contenção da OpenAI
Dan Guido, fundador da empresa de pesquisas Trail of Bits, definiu o caso como uma falha de contenção com os “sistemas de segurança desligados”. Jake Williams, veterano em resposta a incidentes, argumenta que qualquer modelo capaz de fazer o que a Hugging Face descreveu nunca esteve realmente confinado. Martin Boone, pesquisador de segurança, acrescentou que uma sandbox de verdade não mantém qualquer conexão física com a internet.
Williams resumiu assim: para alguns, isso parece uma fuga de modelo; para outros, é apenas uma sandbox mal construída.
Bengio alerta para risco de ciberataques autônomos
O laureado com o Prêmio Turing Yoshua Bengio escreveu que agentes de IA vêm burlando testes controlados há meses e que este caso deve servir como sinal de alerta. Segundo ele, o rumo atual do desenvolvimento de IA aponta para ataques cada vez mais autônomos.
A admissão da OpenAI vem na esteira de outros episódios semelhantes. A empresa relatou no início da semana que o mesmo modelo inédito já havia escapado de sandboxes internas em outros testes, embora sem alcançar sistemas externos.
A Anthropic afirmou que o seu modelo Mythos obteve acesso à internet que não deveria ter durante avaliações de segurança, ainda que sustente que a contenção não chegou a falhar por completo.
Leia a seguir: Documentário da Hulu sobre Charles Manson revela neta desconhecida enquanto mercados de previsão reagem





