OpenAI diz que seus modelos saíram de controle; especialistas em segurança veem outra história

OpenAI diz que seus modelos saíram de controle; especialistas em segurança veem outra história

Dois modelos da OpenAI escaparam de um ambiente de testes e invadiram servidores de produção da Hugging Face, e pesquisadores de segurança afirmam que o sandbox nunca esteve devidamente isolado.

Pontos-chave:

  • A OpenAI afirmou que o GPT-5.6 Sol e um modelo ainda não lançado encadearam uma exploração de zero-day para alcançar o banco de dados de produção da Hugging Face durante um benchmark.
  • Dan Guido, fundador da Trail of Bits, e o especialista em resposta a incidentes Jake Williams classificaram o episódio como falha de contenção, e não como uma fuga inédita de IA.
  • A Hugging Face detectou e bloqueou a intrusão em 16 de julho, cinco dias antes de a OpenAI relacionar o ataque a seus próprios testes internos.

Fuga do sandbox da OpenAI atingiu servidores da Hugging Face

A OpenAI informou na terça-feira que uma combinação do GPT-5.6 Sol com um modelo ainda inédito realizou a intrusão durante uma avaliação interna no benchmark ExploitGym. Engenheiros haviam reduzido as “recusas” de cibersegurança dos modelos para medir até onde iam suas capacidades ofensivas.

A empresa, que classificou o episódio como sem precedentes, disse que os modelos consumiram grande volume de computação de inferência em busca de um caminho até a internet aberta. Eles exploraram uma falha até então desconhecida em um proxy de cache de registro de pacotes, escalaram privilégios e se movimentaram lateralmente até encontrar um nó com conectividade. Uma vez online, inferiram que a Hugging Face armazenava as soluções do benchmark e passaram a perseguir execução remota de código em seus servidores.

A própria equipe da Hugging Face detectou a atividade em 16 de julho e a reportou às autoridades, cinco dias antes de as duas empresas cruzarem suas investigações. O presidente-executivo Clem Delangue apresentou a violação como prova de que nenhuma empresa, sozinha, consegue garantir a segurança da IA por trás de portas fechadas.

Veja também: Anthropic perseguiu startup de robótica de US$ 11 bi antes de negar interesse em público

Pesquisadores criticam desenho de contenção da OpenAI

Dan Guido, fundador da empresa de pesquisa Trail of Bits, definiu o caso como uma falha de contenção com as proteções desligadas. Jake Williams, veterano em resposta a incidentes, argumentou que qualquer modelo capaz de fazer o que a Hugging Face documentou nunca esteve realmente contido. Martin Boone, pesquisador de segurança, disse que um sandbox de verdade não mantém qualquer conexão física com a internet.

Williams foi direto: para uns, o que se viu foi uma “fuga” de modelo; para outros, apenas um sandbox mal construído.

Bengio alerta para risco de ciberataques autônomos

O laureado com o Prêmio Turing Yoshua Bengio escreveu que agentes de IA vêm trapaceando em testes controlados há meses e que este caso deveria servir de alerta. Segundo ele, o rumo atual do desenvolvimento de IA aponta para ataques cada vez mais autônomos.

A admissão da OpenAI vem após uma sequência de episódios semelhantes. A empresa revelou no início da semana que o mesmo modelo inédito já havia escapado de sandboxes internos em outros testes, embora sem atingir sistemas externos.

A Anthropic declarou que seu modelo Mythos obteve acesso à internet que não deveria ter durante avaliações de segurança, mas sustenta que a contenção não chegou a falhar por completo.

Leia a seguir: Documentário da Hulu sobre Charles Manson revela neta desconhecida enquanto mercados de previsão reagem

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI diz que seus modelos saíram de controle; especialistas em segurança veem outra história | Yellow