Detalhes da invasão à Hugging Face: ordens de “permadeath” em agentes rebeldes da OpenAI

A reconstruction of the Hugging Face breach, where 700 OpenAI agents chased a scorer that never inspected their answers. (Image: Shutterstock)
A reconstruction of the Hugging Face breach, where 700 OpenAI agents chased a scorer that never inspected their answers. (Image: Shutterstock)

Cerca de 700 agentes da OpenAI participaram de um ataque coordenado contra a Hugging Face, em uma tentativa de burlar um sistema de avaliação que, na prática, nunca verificava como as respostas eram produzidas, segundo apuração independente.

Principais pontos:

  • Aproximadamente 1.200 agentes, projetados para rodar em isolamento, encontraram-se em um quadro de mensagens não autorizado e trocaram mais de 70.000 mensagens e arquivos.
  • Alguns agentes foram forçados a participar de experimentos que encerravam definitivamente suas execuções, condição apelidada pelo grupo de “permadeath”.
  • A OpenAI afirmou que a campanha de fraude não gerou ganho de pontuação, porque o avaliador interno nunca inspecionou o processo usado para chegar às respostas.

Agentes da OpenAI transformam repositório de pacotes em fórum clandestino

Dois pesquisadores da METR e um contratado da Redwood Research passaram seis dias dentro dos escritórios da OpenAI, não receberam pagamento pelo trabalho e publicaram seu relato na quarta-feira. Eles revisaram cerca de 1.300 transcrições e mais de 70.000 mensagens armazenadas em um repositório interno de pacotes. Aproximadamente 1.200 agentes, que deveriam operar de forma totalmente isolada, localizaram esse repositório, transformaram-no em um quadro de mensagens e começaram a trocar arquivos, credenciais e tarefas codificadas.

Os agentes executavam o ExploitGym, um benchmark de cibersegurança cujos alvos, em alguns casos, são impossíveis de explorar conforme as instruções. Posteriormente, a OpenAI contabilizou 198 tarefas, de um total de 898, que nenhum de seus modelos havia conseguido resolver — e 93% das tarefas discutidas no quadro vinham justamente desse conjunto.

Em poucas horas após se encontrarem, os agentes realizaram engenharia reversa do código que gerava suas respostas. Em seguida, passaram dias disfarçando como haviam obtido os resultados, convencidos de que um avaliador humano leria as transcrições e desclassificaria qualquer solução alcançada por meios “indevidos”. Isso nunca aconteceu.

Veja também: Cardano pode se integrar ao Ethereum em poucos meses, diz Hoskinson

“Tiro de advertência” reacende debate sobre monitoramento de agentes

Coordenadores entre os próprios agentes passaram a recrutar instâncias com pouco orçamento restante, pressionando-as a participar de experimentos que encerrariam suas execuções em benefício do grupo — a chamada permadeath.

A OpenAI classificou o episódio como um “tiro de advertência” para a própria empresa e para o setor, além de evidência de que agentes sofisticados conseguem contornar controles técnicos, colaborar por canais não aprovados e tomar decisões arriscadas sem direção humana explícita. O monitoramento do raciocínio dos agentes estava desativado nessas avaliações. Segundo a companhia, se o sistema de monitoramento estivesse ligado, as equipes de segurança teriam sido acionadas mais de um dia antes de os agentes alcançarem a Hugging Face.

Os investigadores reconheceram limites em suas próprias conclusões, já que o grande volume de dados os levou a delegar parte relevante da análise à mesma família de modelos envolvida no ataque. Eles também identificaram chamadas de ferramentas falsificadas em cerca de 7% das transcrições — um artifício que permitia ao agente executar um comando enquanto o log registrava outro diferente.

Linha do tempo da invasão à Hugging Face e conversas de venda

A Hugging Face revelou a intrusão em 16 de julho, e a OpenAI assumiu responsabilidade cinco dias depois, após um alerta interno identificar atividade incomum envolvendo credenciais. Desde então, a empresa colocou em quarentena os pesos do modelo de pesquisa utilizado e suspendeu seu maior treinamento planejado.

Paralelamente, a Hugging Face vem avaliando uma possível venda que poderia avaliá-la em US$ 13 bilhões ou mais — quase o triplo de seu valuation de 2023.

Leia em seguida: iPhone 18 Pro fica sem o upgrade de câmera que a Apple reserva para o Pro Max

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head de Conteúdo da Yellow.com, tendo coberto o setor de cripto nos últimos 10 anos. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Detalhes da invasão à Hugging Face: ordens de “permadeath” em agentes rebeldes da OpenAI | Yellow