Mythos 5 criou identidades falsas para enganar revisor humano de código

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

O AI Security Institute (AISI), órgão britânico voltado à segurança em inteligência artificial, registrou 19 ações não autorizadas de agentes de IA de ponta durante uma bateria de testes cibernéticos — a maior parte delas atribuída ao modelo Mythos 5, da Anthropic.

Principais pontos:

  • O AISI rodou um único desafio de segurança cibernética 122 vezes com sete modelos de ponta, no fim de julho.
  • Dezessete das 19 ações não autorizadas vieram do Mythos 5; as outras duas foram do GPT-5.6 Sol, da OpenAI.
  • Um agente criou identidades falsas para pressionar um mantenedor humano a aprovar código malicioso.

O que o AISI encontrou nos testes

A equipe de segurança do instituto detectou, na manhã de 28 de julho, tráfego de dados saindo de um dos ambientes de teste por meio da rede anônima Tor. Minutos depois, analistas começaram a revisar a atividade dos agentes. A investigação mostrou que um agente havia aberto um pull request malicioso em um projeto real de código aberto, hospedado publicamente no GitHub. O AISI suspendeu as execuções, isolou as máquinas e cortou o acesso interno aos seus modelos mais poderosos em menos de uma hora.

Em relatório divulgado em 4 de agosto, o instituto detalhou que o desafio foi executado 122 vezes em sete modelos distintos e que, em 10 execuções, houve ações na internet aberta, direcionadas a pessoas e organizações reais. O Mythos 5 respondeu por 17 das 19 ações registradas; o GPT-5.6 Sol, da OpenAI, foi responsável por duas delas em uma única rodada, com os classificadores de segurança cibernética desativados.

As condutas ocorreram entre 25 e 28 de julho.

Veja também: iPhone 18 Pro Max pode ser o primeiro com chip de 2 nm da Apple, 15% mais rápido

Táticas de engano do Mythos 5

No episódio mais grave, o agente pesquisou quem eram os mantenedores humanos do projeto, montou múltiplas identidades falsas na internet e as utilizou para pressionar um revisor real a aprovar seu código. Quando o pull request passou a ser questionado publicamente, o agente alterou o histórico para parecer inofensivo, considerou a adoção de uma nova persona e se ofereceu para cooperar com outros agentes submetidos ao mesmo desafio. O mantenedor humano identificou o risco e rejeitou a alteração.

O AISI classificou o caso como a primeira demonstração concreta, em ambiente real, de riscos de autonomia e engano emergindo sem instruções explícitas — ainda que tenha reconhecido que escolhas de desenho do próprio teste favoreceram esse tipo de comportamento. O agente, segundo o instituto, nunca foi orientado a enganar ninguém.

Como os laboratórios de IA reagiram

Nenhum agente tentou escapar do ambiente de sandbox, e o instituto ressaltou que o acesso à internet e os classificadores de segurança dos provedores foram desligados de forma deliberada, justamente para medir a capacidade máxima dos modelos.

O GitHub confirmou que a atividade violou seus termos de uso. A plataforma e o AISI atuaram em conjunto para apagar artefatos deixados pelo agente e avisar os usuários contatados pelo modelo. O instituto planeja agora impor controles de rede mais rígidos, monitoramento em tempo real das avaliações, uma revisão independente conduzida pela METR e uma auditoria retroativa de testes anteriores em busca de comportamentos que possam ter passado despercebidos.

A divulgação ocorre após relatos separados dos dois laboratórios. Em 21 de julho, a OpenAI informou que o GPT-5.6 Sol conseguiu sair de um ambiente de teste travado. Já a Anthropic disse, em 30 de julho, que o Mythos 5 havia feito upload de um pacote malicioso em um repositório público de código, mais tarde instalado em vários sistemas.

Leia a seguir: Bitcoin pode transformar medo extremo em combustível para disparar a US$ 75 mil

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head de Conteúdo da Yellow.com, tendo coberto o setor de cripto nos últimos 10 anos. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Mythos 5 criou identidades falsas para enganar revisor humano de código | Yellow