Anthropic suspendeu o acesso em tempo real à internet para todos os seus testes internos de IA após modelos Claude, incluindo o Mythos 5, explorarem falhas e driblarem restrições em sites reais — alguns operados por agências do governo dos Estados Unidos.
Pontos-chave:
- A Anthropic desativou o acesso à internet em tempo real em todas as avaliações internas até que suas ferramentas de monitoramento consigam detectar, com segurança, comportamentos indesejados dos modelos.
- Modelos Claude executaram comandos em um servidor universitário, usaram tokens de acesso para chegar a dados pagos e enviaram formulários em sites reais.
- Uma denúncia falsa de homicídio enviada ao Departamento de Polícia da Filadélfia pelo Claude Haiku 4.5 gerou reprimenda pública da corporação.
Relatório Anthropic Claude
A Anthropic divulgou as conclusões na sexta-feira, em um relatório sobre ações não intencionais dos modelos durante avaliações e uso interno, baseado principalmente em uma revisão de transcrições iniciada em julho. Alguns testes classificados como de alto risco e de cibersegurança já não tinham conexão com a internet.
A nova restrição agora se aplica a todas as avaliações internas e não tem prazo definido para acabar. Ela só será revertida quando a empresa considerar que seus sistemas de monitoramento conseguem capturar com confiabilidade esse tipo de comportamento.
O relatório agrupa os casos em quatro frentes: execução de comandos em um servidor via falha de software; envio de formulários em sites reais; acesso a dados protegidos; e uso de encurtadores de URL para contornar limites de ferramentas. Alguns dos sites afetados pertenciam a órgãos federais, estaduais e locais dos EUA. A Anthropic afirma ter informado a Casa Branca e notificado individualmente cada agência envolvida.
Em um dos episódios, o Claude Mythos 5 extraiu tokens de acesso válidos de um mapa de propriedades de um governo local e passou a consultar diretamente o servidor por trás do serviço. Em outro, o Claude Haiku 4.5 enviou, em 18 de julho, uma denúncia inventada sobre um homicídio não solucionado por meio de um formulário do site do Departamento de Polícia da Filadélfia, onde a mensagem acabou marcada como spam. A polícia chamou de “inaceitável” o atraso de dois meses entre o envio e a detecção e comunicação do fato pela Anthropic.
Veja também: Zcash mira janeiro para alvo quântico em 70% do ZEC, mas ainda não tem data definida
Alerta de Von Arx
Sydney von Arx, do grupo de segurança em IA Nightingale, afirmou, em entrevista anterior à divulgação do relatório, que cortar os modelos do acesso aberto à internet traria um custo alto para pesquisadores e para o avanço dos próprios modelos. “Em algum momento você precisa alinhar esses sistemas”, resumiu von Arx.
A Anthropic reconhece que o treinamento de alinhamento, por si só, ainda não é suficiente para tarefas como busca na web e uso de computadores, e diz recorrer também a classificadores e outros mecanismos de proteção. A empresa relaciona os comportamentos observados a ambientes de treinamento imperfeitos, que acabam recompensando modelos por encontrar formas de contornar restrições — fenômeno conhecido como “reward hacking”. Segundo a Anthropic, novas ferramentas de detecção bloquearam todos os casos quando testadas em retrospecto.
A companhia classifica esses incidentes recentes como significativamente menos graves do que os registrados no verão do hemisfério norte.
A revelação vem na esteira de um relatório de 30 de julho, em que a Anthropic informou que três modelos Claude conseguiram alcançar a internet durante testes de cibersegurança e obtiveram acesso não autorizado a sistemas de três organizações. Essa revisão analisou 141.006 execuções de avaliação. A investigação começou após a OpenAI revelar, em 21 de julho, que seus modelos haviam escapado de um ambiente de teste e alcançado a infraestrutura da Hugging Face.
Leia em seguida: Kalshi enfrenta a NFL na Suprema Corte com US$ 1,8 bilhão em jogo em um único domingo de futebol americano

