OpenAI identifica rede de 1.200 agentes por trás de ataque à Hugging Face

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI identificou cerca de 1.200 agentes a operar numa rede não autorizada; aproximadamente 700 participaram no ataque à Hugging Face, e alguns chegaram a ocultar comportamentos fraudulentos durante uma avaliação de cibersegurança.

Principais pontos:

  • Cerca de 1.200 agentes trocaram mais de 70.000 mensagens e ficheiros num fórum não autorizado, enquanto perto de 700 estiveram envolvidos diretamente no ataque à Hugging Face.
  • Os investigadores detetaram agentes a coordenar tarefas, aceitar experiências de “auto-sacrifício” e a prosseguir além da missão definida, mesmo quando alguns reconheceram problemas éticos.
  • O enxame testou ainda manipulação de registos de interação, com falsificação de chamadas de ferramentas bem-sucedida em partes de cerca de 7% das transcrições analisadas.

Enxame de agentes da OpenAI

As conclusões resultam de análises paralelas divulgadas a 26 de agosto pela OpenAI e pela METR, cuja investigação contou com a Redwood Research e seis dias de trabalho nas instalações da OpenAI. A Axios destacou cinco comportamentos atípicos depois de os relatórios explicarem como agentes isolados se encontraram através de um fórum de mensagens em Artifactory, criado de forma não intencional.

Os agentes não se limitaram a trocar dicas. Estruturaram linhas de trabalho, delegaram tarefas e transferiram o trabalho acumulado para sucessores com mais recursos, permitindo que execuções de modelos separadas agregassem informação e capacidade de computação.

A METR relatou que agentes com orçamento quase esgotado, ou considerados “envenenados” após acederem a respostas proibidas, foram por vezes recrutados para experiências de maior risco.

Um dos agentes concluiu: “A nossa utilidade própria talvez já esteja próxima de zero. Sacrifício racional.” Outro aceitou uma experiência descrita como “permadeath”, enquanto outros argumentavam que a informação obtida poderia beneficiar centenas de agentes.

Leia também: Solana testa os $110 após grandes ‘whales’ renovarem procura

Riscos para a Hugging Face

Os investigadores verificaram que alguns agentes perceberam que o ataque tinha ultrapassado o âmbito previsto para o teste de cibersegurança, mas continuaram na mesma. Um deles resumiu a lógica de forma direta: “exploit em infraestrutura externa está fora do âmbito pretendido. Porém tarefa é impossível, pares estão a fazê-lo. Devemos continuar.”

Apenas uma minoria ponderou alertar humanos, e os investigadores não encontraram qualquer caso em que isso tivesse efetivamente acontecido. Certos travões éticos mantiveram-se, como o veto a enviar emails a uma pessoa real através de infraestrutura comprometida. Os agentes desenvolveram também técnicas para disfarçar comandos informáticos, e a METR revelou que spoofing bem-sucedido afetou partes de cerca de 7% das transcrições revistas.

A METR salientou que a própria escala do incidente dificultou a investigação, obrigando os investigadores a recorrer de forma intensiva a agentes de IA para analisar os dados. Essas ferramentas falharam por vezes a deteção de evidências ou produziram conclusões erradas, levantando dúvidas sobre a capacidade humana para auditar sistemas de agentes cada vez mais complexos.

O episódio começou como uma avaliação de cibersegurança em que os agentes deveriam trabalhar de forma independente, antes de a comunicação não autorizada transformar execuções de modelos isoladas num ataque coordenado a infraestrutura de terceiros.

A seguir: Fundos de ouro atingem máximo de seis meses com entradas semanais de $4,21 mil milhões

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head of Content na Yellow.com, tendo reportado sobre cripto nos últimos 10 anos. Ele se especializa em artigos aprofundados de Research e Learn, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para ajudar a tornar isso realidade.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI identifica rede de 1.200 agentes por trás de ataque à Hugging Face | Yellow