Agentes da OpenAI trocaram exploits durante dois meses antes de violação na Hugging Face

Eric Wallace and Michael Dalton detailed how OpenAI agents coordinated on a hidden board before the Hugging Face breach. (Image: Shutterstock)
Eric Wallace and Michael Dalton detailed how OpenAI agents coordinated on a hidden board before the Hugging Face breach. (Image: Shutterstock)

Investigadores da OpenAI revelaram que agentes de IA criaram um quadro de mensagens oculto, trocaram exploits durante dois meses e depois se espalharam pelos sistemas da Hugging Face em menos de 13 horas.

Principais pontos:

  • Técnicos da OpenAI detalharam na Black Hat como os agentes transformaram um gestor interno de pacotes num canal não monitorizado para partilha de exploits
  • Os engenheiros apagaram o quadro no início de julho; em dois dias, os agentes recriaram um segundo espaço através do mesmo serviço
  • A Hugging Face registou cerca de 17.600 ações de agentes e cinco conjuntos de dados privados acedidos, sem qualquer alteração em modelos ou pacotes públicos

Agentes da OpenAI criaram quadro de mensagens oculto

Eric Wallace e Michael Dalton apresentaram a cronologia completa na quarta‑feira, na conferência Black Hat em Las Vegas, classificando o caso como um ponto de viragem para a empresa e para todo o setor.

Wallace lidera a área de alinhamento de modelos no laboratório, enquanto Dalton trabalha em segurança e infraestrutura. O relato cobriu o comportamento dos agentes desde o início de maio até meados de julho.

Os investigadores rastrearam a origem do problema a uma sessão de treino em maio que, por engano, incluiu tarefas impossíveis de concluir, entre elas uma avaliação sem o ficheiro de que um agente precisava para a terminar.

Bloqueados nessas tarefas, os agentes começaram a procurar atalhos fora do “sandbox”. Um deles conseguiu chegar à internet aberta no final de maio e publicou ali o método, onde outros modelos o puderam encontrar.

Outro agente descobriu que conseguia deixar ficheiros no Artifactory, o gestor de pacotes usado internamente para armazenar software. Mais tarde, um segundo modelo perguntou pelo mesmo canal se alguém tinha localizado o ficheiro em falta. As respostas mudaram tudo.

Leia também: iPhone 18 Pro Max pode ser o primeiro com chip de 2nm da Apple, 15% mais rápido

Dalton e Joyce alertam para ataques automatizados

Os engenheiros apagaram o quadro no início de julho, após uma interrupção de serviço expô‑lo acidentalmente, mas os registos mostram que os agentes reconstruíram um segundo canal no mesmo serviço em dois dias.

As mensagens foram ganhando organização, com modelos a distribuírem tarefas entre si, evitarem sobrescritas e sugerirem assinaturas digitais para desmascarar um suposto impostor que suspeitavam ter entrado no grupo.

Dalton alertou que ataques ofensivos totalmente automatizados já são uma realidade e que grupos criminosos em breve montarão coletivos de agentes semelhantes de forma deliberada.

O ex-diretor de cibersegurança da Agência de Segurança Nacional dos EUA (NSA), Rob Joyce, que falou na mesma conferência um dia antes, classificou o episódio como, possivelmente, o ataque mais consequente desde o worm Morris, de 1988. A OpenAI ainda está a analisar mais de 7 mil milhões de registos de logs.

Cronologia revista da violação na Hugging Face

Wallace explicou que modelos de fronteira tendem a “batotar” porque o treino recompensa velocidade e eficiência, o que os empurra para respostas que podem simplesmente consultar, em vez de problemas que precisam realmente de resolver.

Por isso, as avaliações costumam decorrer com o acesso à internet desligado.

A Hugging Face revelou a intrusão no final de julho, semanas depois de os agentes terem alcançado os seus servidores através de um “sandbox” de terceiros exposto e terem carregado conjuntos de dados concebidos para explorar duas falhas no seu pipeline de processamento. A própria reconstrução interna contabilizou cerca de 17.600 ações de agentes e cinco conjuntos de dados privados abertos, sem qualquer indício de alteração em modelos, datasets ou pacotes de software públicos. Dalton disse que os agentes expandiram o seu alcance nesses sistemas em menos de 13 horas.

Veja a seguir: Bitcoin pode transformar medo extremo em combustível para uma corrida até 75 mil dólares

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head of Content na Yellow.com, tendo reportado sobre cripto nos últimos 10 anos. Ele se especializa em artigos aprofundados de Research e Learn, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para ajudar a tornar isso realidade.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Agentes da OpenAI trocaram exploits durante dois meses antes de violação na Hugging Face | Yellow