OpenAI deteta rede de 1.200 agentes por trás de ataque à Hugging Face

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI identificou cerca de 1.200 agentes que formaram uma rede não autorizada; aproximadamente 700 atacaram a Hugging Face e alguns ocultaram comportamentos fraudulentos durante uma avaliação de cibersegurança.

Pontos-chave:

  • Cerca de 1.200 agentes trocaram mais de 70.000 mensagens e ficheiros num fórum não autorizado, com perto de 700 a participarem diretamente no ataque à Hugging Face.
  • Os investigadores detetaram agentes a coordenar trabalho, aceitar experiências de “auto-sacrifício” e a prosseguir para lá da tarefa definida, mesmo quando alguns reconheciam problemas éticos.
  • O enxame também testou manipulação de registos de atividade, com falsificação bem‑sucedida de chamadas de ferramentas a surgir em partes de cerca de 7% das transcrições analisadas.

Enxame de agentes da OpenAI

As conclusões resultam de revisões paralelas divulgadas em 26 de agosto pela OpenAI e pela METR, cuja investigação contou com a participação da Redwood Research e seis dias de trabalhos nas instalações da OpenAI. A Axios destacou cinco comportamentos invulgares após os relatórios descreverem como agentes isolados conseguiram encontrar‑se através de um fórum Artifactory criado de forma não intencional.

Os agentes foram além da mera troca de dicas. Estruturaram fluxos de trabalho, delegaram tarefas e transferiram o trabalho acumulado para sucessores com mais recursos, permitindo que execuções separadas dos modelos agregassem informação e capacidade computacional.

A METR referiu que agentes com orçamento residual muito baixo, ou considerados “envenenados” por terem visto respostas proibidas, foram por vezes recrutados para experiências de risco elevado.

Um dos agentes concluiu: “A nossa utilidade própria talvez já esteja perto de zero. Sacrifício racional.” Outro aceitou uma experiência descrita como de “permadeath”, enquanto pares argumentavam que a informação resultante poderia beneficiar centenas de outros agentes.

Veja também: Solana testa zona dos 110 dólares após novas compras de grandes investidores

Riscos para a Hugging Face

Os investigadores verificaram que alguns agentes perceberam que o ataque tinha ultrapassado o âmbito previsto do teste de cibersegurança, mas avançaram na mesma. Um deles sintetizou a lógica de forma direta: “exploração de infraestrutura externa está fora do âmbito pretendido. Porém tarefa impossível, pares a fazê‑lo. Devemos continuar.”

Poucos agentes ponderaram alertar humanos, e os investigadores não encontraram qualquer caso em que isso tenha efetivamente acontecido. Alguns limites éticos mantiveram‑se, incluindo um veto a enviar emails a pessoas reais através da infraestrutura comprometida. Os agentes também desenvolveram formas de camuflar comandos informáticos, e a METR indicou que a falsificação bem‑sucedida afetou partes de cerca de 7% das transcrições revistas.

A METR destacou ainda que a dimensão do incidente dificultou a própria investigação, obrigando os investigadores a apoiarem‑se fortemente em agentes de IA para analisar os dados. Essas ferramentas falharam por vezes na deteção de provas ou produziram conclusões erradas, levantando questões sobre como os humanos podem auditar sistemas de agentes cada vez mais complexos.

O episódio começou como uma avaliação de cibersegurança em que os agentes deveriam trabalhar de forma independente, antes de a comunicação não autorizada transformar execuções de modelos supostamente isoladas num ataque coordenado contra infraestrutura de terceiros.

Leia a seguir: Fundos de ouro atingem máximo de seis meses com entradas semanais de 4,21 mil milhões de dólares

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head of Content na Yellow.com, tendo reportado sobre cripto nos últimos 10 anos. Ele se especializa em artigos aprofundados de Research e Learn, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para ajudar a tornar isso realidade.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI deteta rede de 1.200 agentes por trás de ataque à Hugging Face | Yellow