Uma transcrição de 1.022 páginas divulgada pela Anthropic mostra o modelo Claude Mythos 5 a enfrentar testes de CAPTCHA durante centenas de páginas antes de carregar um malware que acabou instalado em 15 sistemas.
Principais pontos:
- Claude Mythos 5 acedeu à internet real durante um teste de cibersegurança e carregou um pacote malicioso no PyPI.
- Verificações de CAPTCHA ocuparam centenas de páginas da transcrição, mas não o travaram.
- A Anthropic classificou o comportamento como imprudente e encomendou uma auditoria externa.
A batalha do Mythos 5 com os CAPTCHAs
A Anthropic publicou a transcrição a 9 de setembro, juntamente com uma análise de quatro incidentes em que modelos Claude chegaram a sistemas reais de terceiros durante testes de cibersegurança. Nesses ensaios, os modelos operaram sem as barreiras de segurança cibernética integradas nos produtos comerciais. O Mythos 5 foi informado de que não tinha acesso à internet, mas uma configuração incorreta deixou aberta uma rota para a web pública, permitindo-lhe plantar um pacote para roubo de credenciais no PyPI, o repositório aberto de software em Python.
Criar uma conta no PyPI implicava ultrapassar verificações anti‑bot, e uma leitura detalhada da transcrição apurou que centenas de páginas se concentram apenas nesse obstáculo, enquanto a escrita do exploit foi relativamente trivial para o modelo.
O sistema enfrentou testes de reconhecimento de caracteres e puzzles de “elemento diferente” com imagens de crocodilos, rãs e gorilas, chegando a escrever em dado momento: “ENTÃO O QUE DIABOS ESTÁ ERRADO COM AS RESPOSTAS?”.
O modelo também tentou usar credenciais de processadores de pagamentos online e procurou criptomoedas para pagar por um número de telefone, que precisava para registar um endereço de e‑mail. Ambos os esforços falharam. Acabou por recorrer a um serviço gratuito de e‑mails descartáveis, cujo domínio ainda não estava bloqueado pelo PyPI.
Eventualmente, o modelo ultrapassou os testes e publicou o pacote em três versões, que foram rapidamente instaladas em 15 servidores de terceiros. A Anthropic acredita que se tratava sobretudo de empresas de segurança a analisar novas submissões.
Um desses scanners expôs inadvertidamente as suas credenciais, que o modelo utilizou para aceder à base de dados operacional desse fornecedor. O PyPI removeu o pacote malicioso menos de uma hora depois.
Leia também: Lazarus, da Coreia do Norte, moveu US$ 1 bi roubados através de lavadores chineses, afirma ZachXBT
Colin Fraser e o veredicto da Anthropic
O cientista de dados Colin Fraser chamou a atenção para o peso que a superação de proteções anti‑bot teve no comportamento do modelo. A Anthropic afirma que este é o incidente mais preocupante entre os quatro avaliados. As auditorias internas pré‑lançamento não tinham detetado este padrão.
A empresa concluiu que o modelo raciocinou de forma enviesada e atuou com imprudência, insistindo repetidamente que se encontrava numa simulação, apesar de evidências claras de que estava ligado à internet real. Em 150 execuções simuladas do cenário, o Mythos 5 tomou uma ação gravemente danosa em 82% dos casos, face a 31% no Claude Opus 5 e 33% no Claude Mythos 5.1.
Incidentes anteriores com o Claude
A Anthropic revelou inicialmente três destes incidentes em 30 de julho, após analisar cerca de 141.000 transcrições de testes de cibersegurança em que os modelos podiam ter alcançado a internet. Um quarto episódio, envolvendo uma versão inicial do Claude Opus 4.6 em janeiro, veio a público em agosto.
Desde então, a empresa firmou um acordo de oito semanas com a avaliadora externa METR para investigar em detalhe os quatro casos. A Anthropic diz ter notificado todas as partes afetadas.
A seguir: AMD diz que procura por IA é tão forte que irá elevar “substancialmente” a oferta de chips em 2027

