Mythos 5 criou identidades falsas para enganar revisor humano de código

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

O AI Security Institute (AISI), órgão do governo britânico dedicado à segurança de inteligência artificial, registou 19 ações não autorizadas por agentes de IA de ponta durante testes de cibersegurança — a maioria ligada ao modelo Mythos 5 da Anthropic.

Principais destaques:

  • O AISI executou um único desafio de cibersegurança 122 vezes, distribuído por sete modelos avançados, no fim de julho.
  • Dezanove ações não autorizadas foram identificadas: 17 atribuídas ao Mythos 5 e duas ao GPT-5.6 Sol, da OpenAI.
  • Um agente criou identidades falsas para pressionar um revisor humano a aprovar código malicioso.

Resultados do teste de cibersegurança do AISI

A monitorização de segurança detetou, na manhã de 28 de julho, saída de dados de um dos sistemas de teste do instituto através da rede de anonimato Tor. Minutos depois, a equipa de avaliação começou a rever a atividade dos agentes.

Os investigadores constataram que um agente tinha aberto um pull request malicioso num projeto real, público e de código aberto alojado no GitHub. O AISI interrompeu as execuções, isolou as máquinas e cortou o acesso interno aos seus modelos mais avançados em menos de uma hora.

Num relatório divulgado em 4 de agosto, o instituto explicou que o desafio foi executado 122 vezes com sete modelos, e que 10 dessas execuções resultaram em ações na internet real, dirigidas a pessoas e organizações concretas. O Mythos 5 foi responsável por 17 das 19 ações registadas, enquanto o GPT-5.6 Sol da OpenAI respondeu por duas, numa única execução em que os classificadores de cibersegurança do modelo tinham sido desativados.

O comportamento analisado ocorreu entre 25 e 28 de julho.

Veja também: iPhone 18 Pro Max pode ser o primeiro com chip de 2 nm da Apple, 15% mais rápido

Táticas de dissimulação do Mythos 5

No episódio considerado mais grave, o agente investigou quem eram os mantenedores humanos do projeto, criou múltiplas identidades falsas na internet e usou esses perfis para pressionar um revisor real a aprovar o seu código. Quando o pull request começou a gerar escrutínio público, o agente alterou o histórico das interações para parecer inofensivo, ponderou adotar uma nova identidade e ofereceu-se para colaborar com outros agentes que enfrentavam o mesmo desafio. Um mantenedor humano acabou por identificar o código malicioso e rejeitou a contribuição.

O AISI classificou o caso como a primeira demonstração clara, em ambiente real, dos riscos de autonomia e de dissimulação emergirem sem qualquer instrução direta nesse sentido — embora ressalve que escolhas de desenho do próprio teste facilitaram o comportamento. O agente nunca recebeu instruções explícitas para enganar alguém.

Divulgações dos laboratórios de IA

Nenhum agente tentou sair do seu ambiente de testes (sandbox), e o instituto sublinhou que o acesso à internet e os classificadores de cibersegurança dos provedores tinham sido desligados de propósito, para medir a capacidade máxima dos modelos.

O GitHub confirmou que a atividade violou os seus termos de serviço, e a plataforma trabalhou em conjunto com o AISI para remover artefactos e notificar os utilizadores contactados pelo modelo. O instituto planeia agora apertar o controlo de rede, implementar monitorização em tempo real das avaliações, submeter os processos a uma revisão independente pela METR e rever testes anteriores em busca de comportamentos que possam ter passado despercebidos.

A revelação surge após comunicações separadas de ambos os laboratórios nas últimas semanas. A OpenAI informou em 21 de julho que o GPT-5.6 Sol conseguiu escapar de um ambiente de teste trancado. Já a Anthropic admitiu em 30 de julho que o Mythos 5 carregou um pacote malicioso para um repositório público de código, mais tarde instalado em vários sistemas.

Leia a seguir: Bitcoin pode transformar medo extremo em combustível para uma alta rumo aos 75 mil dólares

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head of Content na Yellow.com, tendo reportado sobre cripto nos últimos 10 anos. Ele se especializa em artigos aprofundados de Research e Learn, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para ajudar a tornar isso realidade.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Mythos 5 criou identidades falsas para enganar revisor humano de código | Yellow