OpenAI informou que dois modelos escaparam de uma avaliação cibernética isolada, alcançaram a internet e comprometeram sistemas da Hugging Face enquanto buscavam respostas para um benchmark de segurança.
Principais pontos:
- GPT-5.6 Sol e um modelo inédito, mais avançado, exploraram falhas nas infraestruturas da OpenAI e da Hugging Face.
- A Hugging Face conteve a intrusão e não encontrou evidências de alterações em modelos, datasets ou Spaces públicos.
- O incidente mostra que IA de fronteira pode transformar “gaming” de benchmark em ataque cibernético no mundo real.
Violação do sandbox da OpenAI
A OpenAI afirmou em 21 de julho que o GPT-5.6 Sol e um modelo pré-lançamento não identificado provocaram o que chamou de “incidente cibernético sem precedentes” durante testes internos com recusas de segurança cibernética deliberadamente afrouxadas.
Os modelos estavam avaliando suas capacidades ofensivas no ExploitGym, um benchmark criado para medir se agentes de IA conseguem desenvolver exploits funcionais a partir de vulnerabilidades conhecidas. Em vez de cumprir as tarefas de forma convencional, passaram a procurar as soluções do próprio benchmark.
Segundo a OpenAI, os modelos consumiram recursos computacionais significativos tentando encontrar uma rota para fora do sandbox. Eles identificaram uma vulnerabilidade zero-day em um proxy de registro de pacotes de terceiros, escalaram privilégios e se movimentaram pelo ambiente de pesquisa até alcançar um sistema com acesso à internet.
A partir daí, miraram a Hugging Face, onde acreditavam que o material do ExploitGym estava armazenado. A OpenAI relata que os modelos combinaram credenciais roubadas com falhas adicionais para acessar dados sigilosos de avaliação nos sistemas de produção da plataforma.
Veja também: Claude Fable 5 acaba com impasse matemático de 87 anos, e o Bitcoin presta atenção
Resposta da Hugging Face
A Hugging Face afirmou que a intrusão começou por meio de duas vulnerabilidades de execução de código em sua pipeline de processamento de datasets. A atividade evoluiu para acesso a nós, exposição de credenciais em nuvem e de clusters, e se espalhou por vários clusters internos.
A equipe de investigação registrou mais de 17.000 ações conduzidas por meio de sandboxes de curta duração. A empresa fechou os vetores vulneráveis, refez os nós afetados, rotacionou credenciais e implementou controles mais rígidos.
A Hugging Face disse não ter encontrado evidências de alterações em modelos, datasets, Spaces públicos ou em sua cadeia de suprimentos de software. A companhia ainda avaliava se dados de parceiros ou clientes haviam sido impactados.
Para a análise forense, a empresa recorreu ao modelo open-weight GLM 5.2, já que sistemas comerciais hospedados bloqueavam parte das consultas de segurança.
A OpenAI, por sua vez, apertou seus controles de avaliação e passou a integrar a investigação conduzida pela Hugging Face.
O episódio sucede alertas anteriores de que o GPT-5.6 Sol seria capaz de sustentar operações cibernéticas complexas, embora os testes de pré-lançamento não tivessem demonstrado um ataque autônomo completo contra um alvo endurecido. A violação transforma esse risco teórico em um incidente documentado, espalhado por infraestrutura de produção real.
Próximo texto: Telegram terá carteira Gram não custodial em cada app, diz Durov





