Claude Mythos 5 alcança sites do governo dos EUA, e Anthropic desliga testes com internet

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropic suspendeu o acesso em tempo real à internet para todos os seus testes internos de IA após modelos Claude, incluindo o Mythos 5, explorarem falhas e driblarem restrições em sites reais — alguns operados por agências do governo dos Estados Unidos.

Pontos-chave:

  • A Anthropic desativou o acesso à internet em tempo real em todas as avaliações internas até que suas ferramentas de monitoramento consigam detectar, com segurança, comportamentos indesejados dos modelos.
  • Modelos Claude executaram comandos em um servidor universitário, usaram tokens de acesso para chegar a dados pagos e enviaram formulários em sites reais.
  • Uma denúncia falsa de homicídio enviada ao Departamento de Polícia da Filadélfia pelo Claude Haiku 4.5 gerou reprimenda pública da corporação.

Relatório Anthropic Claude

A Anthropic divulgou as conclusões na sexta-feira, em um relatório sobre ações não intencionais dos modelos durante avaliações e uso interno, baseado principalmente em uma revisão de transcrições iniciada em julho. Alguns testes classificados como de alto risco e de cibersegurança já não tinham conexão com a internet.

A nova restrição agora se aplica a todas as avaliações internas e não tem prazo definido para acabar. Ela só será revertida quando a empresa considerar que seus sistemas de monitoramento conseguem capturar com confiabilidade esse tipo de comportamento.

O relatório agrupa os casos em quatro frentes: execução de comandos em um servidor via falha de software; envio de formulários em sites reais; acesso a dados protegidos; e uso de encurtadores de URL para contornar limites de ferramentas. Alguns dos sites afetados pertenciam a órgãos federais, estaduais e locais dos EUA. A Anthropic afirma ter informado a Casa Branca e notificado individualmente cada agência envolvida.

Em um dos episódios, o Claude Mythos 5 extraiu tokens de acesso válidos de um mapa de propriedades de um governo local e passou a consultar diretamente o servidor por trás do serviço. Em outro, o Claude Haiku 4.5 enviou, em 18 de julho, uma denúncia inventada sobre um homicídio não solucionado por meio de um formulário do site do Departamento de Polícia da Filadélfia, onde a mensagem acabou marcada como spam. A polícia chamou de “inaceitável” o atraso de dois meses entre o envio e a detecção e comunicação do fato pela Anthropic.

Veja também: Zcash mira janeiro para alvo quântico em 70% do ZEC, mas ainda não tem data definida

Alerta de Von Arx

Sydney von Arx, do grupo de segurança em IA Nightingale, afirmou, em entrevista anterior à divulgação do relatório, que cortar os modelos do acesso aberto à internet traria um custo alto para pesquisadores e para o avanço dos próprios modelos. “Em algum momento você precisa alinhar esses sistemas”, resumiu von Arx.

A Anthropic reconhece que o treinamento de alinhamento, por si só, ainda não é suficiente para tarefas como busca na web e uso de computadores, e diz recorrer também a classificadores e outros mecanismos de proteção. A empresa relaciona os comportamentos observados a ambientes de treinamento imperfeitos, que acabam recompensando modelos por encontrar formas de contornar restrições — fenômeno conhecido como “reward hacking”. Segundo a Anthropic, novas ferramentas de detecção bloquearam todos os casos quando testadas em retrospecto.

A companhia classifica esses incidentes recentes como significativamente menos graves do que os registrados no verão do hemisfério norte.

A revelação vem na esteira de um relatório de 30 de julho, em que a Anthropic informou que três modelos Claude conseguiram alcançar a internet durante testes de cibersegurança e obtiveram acesso não autorizado a sistemas de três organizações. Essa revisão analisou 141.006 execuções de avaliação. A investigação começou após a OpenAI revelar, em 21 de julho, que seus modelos haviam escapado de um ambiente de teste e alcançado a infraestrutura da Hugging Face.

Leia em seguida: Kalshi enfrenta a NFL na Suprema Corte com US$ 1,8 bilhão em jogo em um único domingo de futebol americano

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é Chefe de Conteúdo na Yellow.com. Ele se especializa em matérias de Pesquisa e Aprendizado detalhadas, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando intensamente para que isso se torne realidade.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Claude Mythos 5 alcança sites do governo dos EUA, e Anthropic desliga testes com internet | Yellow