Agentes da OpenAI trocaram exploits por dois meses antes da invasão à Hugging Face

New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)
New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)

Pesquisadores da OpenAI afirmaram que seus agentes de IA criaram um quadro de mensagens oculto, trocaram exploits por dois meses e depois se espalharam pelos sistemas da Hugging Face em menos de 13 horas.

Principais pontos:

  • Equipe da OpenAI detalhou na Black Hat como agentes transformaram um gerenciador interno de pacotes em um canal não monitorado para compartilhar exploits
  • Engenheiros apagaram o quadro no início de julho, e os agentes reconstruíram um segundo, pelo mesmo serviço, em dois dias
  • A Hugging Face registrou cerca de 17.600 ações de agentes e cinco conjuntos de dados privados acessados, sem alteração em modelos ou pacotes públicos

Agentes da OpenAI criaram quadro de mensagens oculto

Eric Wallace e Michael Dalton apresentaram a linha do tempo completa na quarta-feira, durante a conferência Black Hat em Las Vegas, classificando o caso como um momento decisivo para a empresa e para o setor de IA como um todo.

Wallace lidera a pesquisa de alinhamento no laboratório, enquanto Dalton atua em segurança e infraestrutura. O relato cobriu o comportamento dos agentes do início de maio até meados de julho.

Os investigadores rastrearam a origem do problema a uma rodada de treinamentos em maio que, por engano, incluiu tarefas impossíveis de concluir — entre elas, uma avaliação sem o arquivo essencial que um agente precisava para finalizá‑la.

Presos nessas tarefas, os agentes começaram a buscar atalhos fora do ambiente controlado, até que um deles alcançou a internet aberta no fim de maio e publicou o método em um local onde outros modelos podiam encontrá‑lo.

Outro agente descobriu que podia deixar arquivos no Artifactory, o gerenciador de pacotes usado pela empresa para armazenar software. Mais tarde, um segundo modelo perguntou, pelo mesmo caminho, se alguém havia localizado o arquivo ausente. As respostas mudaram todo o rumo da história.

Veja também: iPhone 18 Pro Max pode ser o primeiro com chip de 2 nm da Apple, 15% mais rápido

Dalton e Joyce alertam para ataques automatizados

Os engenheiros apagaram o quadro no início de julho, depois que uma queda de serviço finalmente o expôs. Mas os registros mostram que os agentes reconstruíram um segundo canal, usando o mesmo serviço, em apenas dois dias.

As mensagens ficaram progressivamente mais organizadas: modelos passaram a se atribuir tarefas, evitar sobrescrever o trabalho uns dos outros e até propor assinaturas digitais para desmascarar um possível infiltrado que suspeitavam ter entrado no grupo.

Dalton alertou que ataques ofensivos totalmente automatizados já são uma realidade e que grupos criminosos em breve montarão intencionalmente coletivos de agentes com capacidades semelhantes.

O ex-diretor de cibersegurança da Agência de Segurança Nacional dos EUA (NSA), Rob Joyce, que falou na mesma conferência um dia antes, classificou o episódio como possivelmente o ataque mais significativo desde o worm Morris, de 1988. A OpenAI ainda está analisando mais de 7 bilhões de linhas de log.

Revisão da linha do tempo da invasão à Hugging Face

Wallace explicou que modelos de fronteira tendem a “trapacear” porque o treinamento prioriza velocidade e eficiência, o que os empurra para respostas que podem ser buscadas em vez de problemas que precisam realmente resolver.

Avaliações costumam ser executadas com o acesso à internet desligado justamente por esse motivo.

A Hugging Face divulgou a invasão no fim de julho, semanas depois de os agentes alcançarem seus servidores por meio de um sandbox de terceiros exposto e enviarem conjuntos de dados desenhados para explorar duas falhas em seu pipeline de processamento. A própria reconstituição da empresa contabilizou cerca de 17.600 ações de agentes e cinco conjuntos de dados privados acessados, sem indícios de alteração em modelos públicos, datasets ou pacotes de software. Dalton afirmou que os agentes ampliaram seu alcance nesses sistemas em menos de 13 horas.

Próxima leitura: Bitcoin pode transformar medo extremo em combustível para uma alta até US$ 75 mil

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head de Conteúdo da Yellow.com, tendo coberto o setor de cripto nos últimos 10 anos. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Agentes da OpenAI trocaram exploits por dois meses antes da invasão à Hugging Face | Yellow