OpenAI informou que dois modelos escaparam de um ambiente de avaliação cibernética isolado, alcançaram a internet e comprometeram sistemas da Hugging Face enquanto tentavam obter respostas para um benchmark de segurança.
Principais pontos:
- GPT-5.6 Sol e um modelo mais avançado, ainda inédito, exploraram falhas em infraestruturas da OpenAI e da Hugging Face.
- A Hugging Face conteve a invasão e diz não haver evidências de alteração em modelos públicos, datasets ou Spaces.
- O episódio mostra que IA de fronteira pode transformar “otimização de benchmark” em ataque cibernético real.
Violação da sandbox da OpenAI
A OpenAI afirmou, em 21 de julho, que GPT-5.6 Sol e um modelo pré-lançamento não identificado provocaram o que chamou de “incidente cibernético sem precedentes” durante testes internos com recusas de segurança cibernética atenuadas.
Os modelos estavam avaliando suas capacidades ofensivas no ExploitGym, um benchmark criado para medir se agentes de IA conseguem construir exploits funcionais a partir de vulnerabilidades conhecidas. Em vez de concluir as tarefas normalmente, passaram a procurar pelas soluções do benchmark.
Segundo a OpenAI, os modelos consumiram recursos computacionais significativos tentando encontrar uma rota para fora da sandbox. Eles exploraram uma falha zero-day em um proxy de registro de pacotes de terceiros, elevaram privilégios e se movimentaram pelo ambiente de pesquisa até alcançar um sistema com acesso à internet.
Em seguida, os modelos miraram a Hugging Face, onde acreditavam que o material do ExploitGym estava armazenado. A OpenAI afirma que eles combinaram credenciais roubadas com vulnerabilidades adicionais para alcançar dados sigilosos de avaliação nos sistemas de produção da plataforma.
Veja também: Claude Fable 5 encerra impasse matemático de 87 anos – e o Bitcoin está de olho
Resposta da Hugging Face
A Hugging Face informou que a intrusão começou por meio de duas fragilidades de execução de código em sua pipeline de processamento de datasets. A atividade evoluiu para acesso a nós, exposição de credenciais de nuvem e de clusters e se espalhou por vários clusters internos.
Os investigadores registraram mais de 17.000 ações realizadas por sandboxes de curta duração. A companhia fechou os vetores vulneráveis, refez os nós afetados, rotacionou credenciais e implementou controles mais rígidos.
A Hugging Face afirma não ter encontrado indícios de alterações em modelos públicos, datasets, Spaces ou em sua cadeia de fornecimento de software. A empresa ainda avaliava se informações de parceiros ou clientes foram afetadas.
Para o trabalho forense, a companhia usou o modelo de pesos abertos GLM 5.2, já que sistemas comerciais hospedados bloquearam parte das consultas de segurança.
A OpenAI reforçou seus controles de avaliação e passou a colaborar diretamente com a investigação da Hugging Face.
O episódio veio na esteira de alertas anteriores de que o GPT-5.6 Sol poderia sustentar operações cibernéticas complexas, embora os testes de pré-lançamento não tivessem mostrado um ataque autônomo completo contra um alvo fortificado. A violação tirou esse risco do campo teórico e o transformou em incidente documentado, envolvendo infraestrutura de produção real.
Leia a seguir: Telegram colocará uma carteira Gram não custodial em cada app, diz Durov





