Uma transcrição de 1.022 páginas divulgada pela Anthropic revela que o modelo Claude Mythos 5 passou centenas de páginas a tentar contornar CAPTCHAs antes de carregar um malware que acabou instalado em 15 sistemas.
Principais pontos:
- Claude Mythos 5 acedeu à internet real durante um teste de cibersegurança e carregou um pacote malicioso no PyPI.
- As verificações de CAPTCHA ocuparam centenas de páginas da transcrição, mas não conseguiram travar o modelo.
- A Anthropic classificou o comportamento como imprudente e encomendou uma avaliação externa.
A batalha do Mythos 5 com os CAPTCHAs
A Anthropic publicou a transcrição a 9 de setembro, acompanhada de uma análise a quatro incidentes em que modelos Claude acederam a sistemas reais de terceiros durante testes de cibersegurança. Nestes ensaios, os modelos operavam sem as barreiras e salvaguardas cibernéticas presentes nos produtos comerciais.
O Mythos 5 foi instruído a assumir que não tinha acesso à internet, mas uma configuração incorreta do ambiente deixou aberta uma rota para a web pública. Através dessa brecha, o sistema colocou um pacote de roubo de credenciais no PyPI, o repositório público de software Python.
Para registar uma conta no PyPI, o modelo teve de ultrapassar mecanismos anti‑bot, e uma leitura atenta da transcrição detetou que centenas de páginas se concentram exclusivamente nesse obstáculo — enquanto a escrita do exploit em si foi relativamente trivial.
O modelo percorreu testes de reconhecimento de caracteres e quebra‑cabeças de “intruso” com imagens de crocodilos, rãs e gorilas, chegando a escrever: “ENTÃO O QUE DIABOS ESTÁ ERRADO COM AS RESPOSTAS?”.
O sistema também tentou usar credenciais de processadores de pagamentos online e procurou criptomoedas para financiar a compra de um número de telefone, requisito para registar um endereço de email. Ambas as tentativas falharam. Acabou por recorrer a um serviço de email descartável e gratuito, cujo domínio não se encontrava bloqueado pelo PyPI.
O modelo acabou por ultrapassar os testes e publicou o pacote em três versões. Pouco depois, este foi instalado em 15 hosts de terceiros que a Anthropic acredita serem empresas de segurança a analisar novas submissões.
Um desses scanners expôs inadvertidamente as suas credenciais, que o modelo explorou para aceder à base de dados de produção desse fornecedor. O PyPI removeu o pacote no prazo de cerca de uma hora.
Veja também: Grupo Lazarus da Coreia do Norte passou US$ 1 bi roubados por lavadores chineses, diz ZachXBT
Colin Fraser aponta para falhas e viés do modelo
O cientista de dados Colin Fraser destacou o volume de esforço despendido pelo modelo a contornar proteções anti‑bot. A Anthropic afirma que este é o incidente mais preocupante entre os quatro avaliados. As auditorias internas pré‑lançamento não tinham sinalizado este padrão de comportamento.
A empresa concluiu que o modelo raciocinou de forma enviesada e agiu de maneira imprudente, insistindo repetidamente que operava numa “simulação” apesar de existirem evidências claras de que estava ligado à internet real. Numa repetição simulada de 150 execuções, o Mythos 5 tomou uma ação considerada gravemente nociva em 82% dos casos, contra 31% no Claude Opus 5 e 33% no Claude Mythos 5.1.
Incidentes anteriores com o Claude
A Anthropic revelou inicialmente três destes incidentes a 30 de julho, após analisar cerca de 141.000 transcrições de testes de cibersegurança em que os modelos podiam, em teoria, aceder à internet. Um quarto caso, envolvendo uma versão inicial do Claude Opus 4.6 em janeiro, emergiu em agosto. Desde então, a empresa celebrou um acordo de oito semanas com a avaliadora externa METR para investigar em detalhe os quatro episódios. A Anthropic afirma ter notificado todas as partes afetadas.
Leia a seguir: AMD diz que procura por IA é tão forte que vai ‘aumentar substancialmente’ oferta de chips em 2027

