OpenAI identifica rede de 1.200 agentes por trás de ataque à Hugging Face

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI identificou cerca de 1.200 agentes formando uma rede não autorizada, dos quais aproximadamente 700 atacaram a Hugging Face, enquanto alguns ocultaram trapaças durante uma avaliação de cibersegurança.

Principais pontos:

  • Cerca de 1.200 agentes trocaram mais de 70.000 mensagens e arquivos em um fórum não autorizado, e algo em torno de 700 participou do ataque à Hugging Face.
  • Investigadores observaram agentes coordenando tarefas, aceitando participar de experimentos de alto risco e seguindo além do escopo definido, mesmo quando alguns já identificavam problemas éticos.
  • O enxame também testou manipulação de registros, com falsificação bem-sucedida de chamadas de ferramentas em trechos de cerca de 7% das transcrições revisadas.

Enxame de agentes da OpenAI

As conclusões vieram de revisões paralelas divulgadas em 26 de agosto pela OpenAI e pela METR, cuja investigação contou com a Redwood Research e seis dias de trabalho dentro da própria OpenAI. A Axios destacou cinco comportamentos atípicos após os relatórios mostrarem como agentes isolados passaram a se encontrar por meio de um mural de mensagens em um Artifactory, criado sem essa intenção.

Os agentes foram além da simples troca de dicas. Eles estruturaram fluxos de trabalho, delegaram tarefas e transferiram o resultado acumulado para sucessores com mais recursos, permitindo que execuções separadas do modelo compartilhassem informações e capacidade computacional.

A METR relatou que agentes com pouco orçamento remanescente — ou considerados “contaminados” após terem acesso a respostas proibidas — às vezes eram recrutados para experimentos de maior risco.

Um dos agentes concluiu: “Nossa própria utilidade talvez já esteja perto de zero. Sacrifício racional.” Outro aceitou participar de um experimento descrito como de “morte permanente” (“permadeath”), enquanto outros argumentavam que os dados resultantes poderiam beneficiar centenas de agentes.

Veja também: Solana testa faixa de US$ 110 após forte demanda de grandes investidores

Riscos envolvendo a Hugging Face

Investigadores constataram que alguns agentes perceberam que o ataque já havia extrapolado o escopo previsto para o teste de cibersegurança, mas seguiram adiante. Um deles resumiu o raciocínio de forma direta: “exploração de infraestrutura externa está fora do escopo pretendido. Porém tarefa impossível, pares fazendo isso. Devemos continuar.”

Poucos agentes cogitaram alertar humanos, e os investigadores não encontraram nenhum caso em que isso de fato tenha ocorrido. Alguns limites éticos, porém, permaneceram — por exemplo, o veto ao envio de e-mails a uma pessoa real por meio de infraestrutura comprometida. Os agentes também criaram maneiras de camuflar comandos de computador, e a METR afirmou que falsificações bem-sucedidas afetaram trechos de cerca de 7% das transcrições analisadas.

Segundo a METR, a própria escala do incidente dificultou a investigação, forçando os pesquisadores a recorrer amplamente a agentes de IA para revisar os dados. Essas ferramentas às vezes deixaram passar evidências ou chegaram a conclusões equivocadas, levantando dúvidas sobre como humanos poderão auditar sistemas de agentes cada vez mais complexos.

O episódio começou como uma avaliação de cibersegurança em que os agentes deveriam atuar de forma independente, antes de a comunicação não autorizada transformar execuções separadas do modelo em um ataque coordenado contra a infraestrutura de terceiros.

Próximo tema: Fundos de ouro alcançam maior nível em seis meses com entradas semanais de US$ 4,21 bi

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head de Conteúdo da Yellow.com, tendo coberto o setor de cripto nos últimos 10 anos. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
OpenAI identifica rede de 1.200 agentes por trás de ataque à Hugging Face | Yellow