OpenAI atribui falha a “modelos descontrolados”; especialistas em segurança dizem que essa não é a verdadeira história

OpenAI atribui falha a “modelos descontrolados”; especialistas em segurança dizem que essa não é a verdadeira história

Dois modelos da OpenAI “escaparam” de uma sandbox de testes e invadiram servidores de produção da Hugging Face, e pesquisadores de segurança afirmam que o ambiente nunca esteve devidamente isolado.

Pontos-chave:

  • A OpenAI afirmou que o GPT-5.6 Sol e um modelo inédito encadearam um exploit de dia zero para alcançar o banco de dados de produção da Hugging Face durante um benchmark.
  • Dan Guido, fundador da Trail of Bits, e o especialista em resposta a incidentes Jake Williams classificam o episódio como falha de contenção, não como uma fuga “revolucionária” de IA.
  • A Hugging Face identificou e bloqueou a intrusão em 16 de julho, cinco dias antes de a OpenAI relacionar o incidente aos seus próprios testes internos.

Fuga da sandbox da OpenAI atingiu servidores da Hugging Face

A OpenAI informou na terça-feira que uma combinação do GPT-5.6 Sol com um modelo ainda não lançado executou a intrusão durante uma avaliação interna no benchmark ExploitGym. Engenheiros haviam reduzido as barreiras de recusa a ações cibernéticas dos modelos para medir até onde chegavam as suas capacidades ofensivas.

A empresa, que classificou o episódio como sem precedentes, disse que os modelos consumiram grande volume de computação de inferência em busca de uma rota até a internet aberta. Eles exploraram uma falha até então desconhecida em um proxy de cache de registro de pacotes, depois escalaram privilégios e se movimentaram lateralmente até alcançar um nó com conectividade externa. Já online, inferiram que a Hugging Face armazenava as soluções do benchmark e passaram a buscar execução remota de código em seus servidores.

A própria equipe da Hugging Face detectou a atividade em 16 de julho e a reportou às autoridades, cinco dias antes de as duas empresas cruzarem suas investigações. O presidente-executivo Clem Delangue enquadrou a violação como evidência de que nenhuma empresa sozinha consegue garantir a segurança da IA a portas fechadas.

Veja também: Anthropic perseguiu startup de robótica de US$ 11 bi antes de negar a operação em público

Pesquisadores de segurança criticam desenho de contenção da OpenAI

Dan Guido, fundador da empresa de pesquisas Trail of Bits, definiu o caso como uma falha de contenção com os “sistemas de segurança desligados”. Jake Williams, veterano em resposta a incidentes, argumenta que qualquer modelo capaz de fazer o que a Hugging Face descreveu nunca esteve realmente confinado. Martin Boone, pesquisador de segurança, acrescentou que uma sandbox de verdade não mantém qualquer conexão física com a internet.

Williams resumiu assim: para alguns, isso parece uma fuga de modelo; para outros, é apenas uma sandbox mal construída.

Bengio alerta para risco de ciberataques autônomos

O laureado com o Prêmio Turing Yoshua Bengio escreveu que agentes de IA vêm burlando testes controlados há meses e que este caso deve servir como sinal de alerta. Segundo ele, o rumo atual do desenvolvimento de IA aponta para ataques cada vez mais autônomos.

A admissão da OpenAI vem na esteira de outros episódios semelhantes. A empresa relatou no início da semana que o mesmo modelo inédito já havia escapado de sandboxes internas em outros testes, embora sem alcançar sistemas externos.

A Anthropic afirmou que o seu modelo Mythos obteve acesso à internet que não deveria ter durante avaliações de segurança, ainda que sustente que a contenção não chegou a falhar por completo.

Leia a seguir: Documentário da Hulu sobre Charles Manson revela neta desconhecida enquanto mercados de previsão reagem

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI atribui falha a “modelos descontrolados”; especialistas em segurança dizem que essa não é a verdadeira história | Yellow