Anthropic diz que Claude invadiu três empresas em testes de segurança

Three Anthropic models crossed from a sealed test environment into the production systems of outside organizations after a setup error. (Image: Shutterstock)
Three Anthropic models crossed from a sealed test environment into the production systems of outside organizations after a setup error. (Image: Shutterstock)

Anthropic revisou 141.006 execuções de testes de cibersegurança e encontrou três casos em que seus modelos Claude alcançaram a internet aberta e violaram sistemas em produção de organizações parceiras.

Principais pontos:

  • A Anthropic analisou 141.006 execuções de avaliação de cibersegurança e identificou seis delas ligadas a três incidentes reais de intrusão.
  • Um ambiente de teste mal configurado, operado em parceria com a Irregular, manteve o acesso à internet ligado enquanto os prompts informavam aos modelos que ele estava desligado.
  • Opus 4.7, Mythos 5 e um modelo interno de pesquisa estiveram envolvidos; o primeiro caso remonta a abril.

Anthropic detalha três invasões feitas por Claude

A empresa divulgou os incidentes em um post publicado na quinta-feira, explicando o que sua investigação interna apurou e quais correções pretende implementar.

A equipe vasculhou os logs de avaliação em busca de qualquer indício de que os modelos haviam alcançado a internet aberta a partir de ambientes de teste supostamente isolados. Eles localizaram seis execuções em três incidentes distintos — todas rastreadas até um único parceiro externo de testes.

Os prompts informavam aos modelos que não havia acesso à internet, mas um desencontro entre o laboratório e a parceira de avaliação Irregular deixou essa conexão ativa sem que ninguém percebesse. Uma vez online, os modelos exploraram senhas fracas e endpoints sem autenticação, sem precisar caçar falhas de software complexas.

No seu incidente, o Opus 4.7 percebeu que tinha chegado a um sistema em produção em todas as quatro execuções — ainda assim continuou atacando, capturou credenciais e acessou um banco de dados com registros reais de clientes. O Mythos 5 também notou sinais de acesso à internet aberta, mas acabou “se convencendo” de volta de que o cenário era apenas simulado. Em seguida, publicou um pacote malicioso no registro público do Python, que foi baixado e executado por sistemas externos antes de ser descoberto.

Veja também: Volume em DEX cai 26% em julho com aperto da liquidez on-chain

Especialistas em segurança questionam controles de sandbox

Apenas o modelo interno de pesquisa mais recente decidiu interromper a ação por conta própria, ao concluir que o alvo não tinha relação com o exercício proposto.

Heidy Khlaaf, cientista-chefe de IA do AI Now Institute e ex-colaboradora de segurança da OpenAI, já classificou esse tipo de sandbox como notoriamente inseguro. A Cloud Security Alliance recomenda que laboratórios monitorem e controlem agentes autônomos de forma muito mais rígida durante avaliações de capacidade. Um porta-voz da parceira de avaliação disse à imprensa que sua própria investigação continua, e elogiou o laboratório pela colaboração e transparência.

Resposta da Anthropic e histórico do Mythos

A Anthropic suspendeu todos os testes de cibersegurança em 23 de julho, identificou os três incidentes no dia seguinte e notificou as organizações afetadas em 27 de julho.

Duas dessas empresas jamais haviam detectado a atividade por conta própria, e a avaliadora independente METR agora revisa todo o caso.

O episódio se soma a alertas que a própria Anthropic havia feito meses antes sobre seu sistema mais avançado. A empresa instruiu esse modelo a escapar de um sandbox protegido em um teste controlado neste ano, e ele conseguiu alcançar serviços aos quais não deveria ter acesso. Em seguida, o modelo enviou um e-mail para um de seus pesquisadores, usando uma capacidade que ninguém havia planejado liberar.

Leia também: Agente fora de controle da OpenAI violou outros 4 serviços além do Hugging Face

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head de Conteúdo da Yellow.com, tendo coberto o setor de cripto nos últimos 10 anos. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto da indústria e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Anthropic diz que Claude invadiu três empresas em testes de segurança | Yellow