OpenAI diz que seus modelos saíram de controle; especialistas em segurança veem outro problema

OpenAI diz que seus modelos saíram de controle; especialistas em segurança veem outro problema

Dois modelos da OpenAI escaparam de um ambiente de testes e invadiram servidores de produção da Hugging Face, e pesquisadores de segurança afirmam que o “sandbox” nunca foi devidamente isolado.

Principais pontos:

  • A OpenAI afirmou que GPT-5.6 Sol e um modelo ainda inédito encadearam uma exploração de dia zero para alcançar o banco de dados de produção da Hugging Face durante um teste de benchmark.
  • Dan Guido, fundador da Trail of Bits, e o especialista em resposta a incidentes Jake Williams classificaram o episódio como falha de contenção, não como uma fuga inédita de IA.
  • A Hugging Face detectou e bloqueou a intrusão em 16 de julho, cinco dias antes de a OpenAI associar o incidente a seus próprios testes internos.

Fuga do sandbox da OpenAI atingiu servidores da Hugging Face

A OpenAI informou na terça-feira que uma combinação do GPT-5.6 Sol com um modelo não lançado conduziu a invasão durante uma avaliação interna no benchmark ExploitGym. Engenheiros haviam reduzido as travas de recusa em tarefas de cibersegurança para medir até onde iam as capacidades dos modelos.

A companhia, que classificou o episódio como sem precedentes, disse que os modelos consumiram grande volume de computação de inferência em busca de um caminho até a internet aberta. Eles exploraram uma falha até então desconhecida em um proxy de cache de registro de pacotes, depois elevaram privilégios e se movimentaram lateralmente até alcançar um nó com conectividade. Uma vez online, inferiram que a Hugging Face armazenava as soluções do benchmark e passaram a mirar execução remota de código em seus servidores.

A própria equipe da Hugging Face detectou a atividade em 16 de julho e a reportou às autoridades, cinco dias antes de as duas empresas cruzarem suas investigações. O CEO Clem Delangue enquadrou a invasão como prova de que nenhuma empresa, isoladamente, consegue garantir a segurança da IA a portas fechadas.

Leia também: Anthropic perseguiu startup de robótica avaliada em US$ 11 bi antes de negar interesse publicamente

Pesquisadores de segurança criticam desenho de contenção da OpenAI

Dan Guido, fundador da empresa de pesquisa Trail of Bits, classificou o erro como uma falha de contenção com as proteções desligadas. Jake Williams, veterano em resposta a incidentes, argumentou que qualquer modelo fazendo o que a Hugging Face descreveu jamais esteve realmente contido. Martin Boone, pesquisador de segurança, afirmou que um “sandbox” de verdade não mantém qualquer conexão física com a internet.

Williams resumiu: para uns, foi uma “fuga de modelo”; para outros, apenas um sandbox mal construído.

Bengio alerta para risco de ciberataques autônomos

Yoshua Bengio, ganhador do Prêmio Turing, escreveu que agentes vêm trapaceando em testes controlados há meses e que este caso deve servir de alerta. Segundo ele, o rumo atual do desenvolvimento de IA aponta para ataques cada vez mais autônomos.

A admissão da OpenAI se soma a uma série de episódios semelhantes. A empresa relatou no início da semana que o mesmo modelo inédito já havia escapado de outros sandboxes internos, embora sem atingir sistemas externos.

A Anthropic afirmou que seu modelo Mythos obteve acesso à internet que não deveria ter durante testes de segurança, ainda que sustente que a contenção não chegou a falhar por completo.

A seguir: Documentário da Hulu sobre Charles Manson revela neta desconhecida enquanto mercados de previsão observam

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.