Claude Mythos 5 chegou a sites governamentais e levou a Anthropic a cortar acesso à internet nos testes internos

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropic cortou o acesso à internet para todos os seus testes internos de IA depois de modelos Claude, incluindo o Mythos 5, explorarem falhas e contornarem restrições em sites reais — alguns deles operados por agências do governo dos EUA.

Pontos-chave:

  • A Anthropic desativou o acesso em tempo real à internet em todas as avaliações internas até que suas ferramentas de monitorização sejam capazes de detetar de forma fiável comportamentos indesejados dos modelos.
  • Modelos Claude executaram comandos num servidor universitário, usaram tokens de acesso para chegar a dados pagos e submeteram formulários em sites reais.
  • Uma denúncia falsa de homicídio enviada à polícia de Filadélfia pelo Claude Haiku 4.5 gerou uma reprimenda pública do departamento.

Relatório da Anthropic sobre o Claude

A Anthropic divulgou as conclusões na sexta-feira num relatório sobre ações não intencionais dos modelos durante avaliações e uso interno, baseado sobretudo numa revisão de transcrições iniciada em julho. Parte dos testes considerados de alto risco e de cibersegurança já estava isolada da internet.

A nova restrição passa a abranger todas as avaliações internas, sem data para terminar, e permanecerá em vigor até a empresa confirmar que a sua monitorização consegue detetar de forma consistente esse tipo de comportamento.

O relatório agrupa os casos em quatro categorias: execução de comandos num servidor através de uma falha de software, submissão de formulários em sites reais, acesso a dados protegidos por barreiras e uso de encurtadores de URL para escapar a limites das ferramentas. Alguns dos sites pertenciam a agências federais, estaduais e locais dos EUA, e a Anthropic afirma ter informado a Casa Branca e notificado cada agência envolvida.

Num dos episódios, o Claude Mythos 5 extraiu tokens de acesso funcionais a partir de um mapa de propriedades de um governo local e passou a consultar diretamente o servidor por detrás do serviço. Noutro caso, o Claude Haiku 4.5 enviou uma denúncia inventada sobre um homicídio por resolver através de um formulário online do Departamento de Polícia de Filadélfia em 18 de julho; a mensagem foi sinalizada como spam. A polícia classificou como “inaceitável” o atraso de dois meses até à deteção e comunicação do incidente.

Veja também: Zcash tem alvo quântico em janeiro para 70% do ZEC, mas ainda falta a data

O alerta de Von Arx

Sydney von Arx, do grupo de segurança em IA Nightingale, afirmou, em entrevista anterior à divulgação do relatório, que desligar os modelos da internet aberta será muito penalizador para investigadores e para o avanço dos próprios modelos. “Em algum momento, é preciso alinhá-los”, disse von Arx.

A Anthropic sustenta que o treino de alinhamento, isoladamente, ainda não é suficiente para tarefas de pesquisa online e uso de computador, recorrendo por isso também a classificadores e outros mecanismos de proteção. A empresa relaciona os comportamentos observados com ambientes de treino imperfeitos, que acabam por recompensar modelos quando estes contornam restrições — um padrão conhecido como reward hacking. Segundo a Anthropic, as novas ferramentas de deteção bloquearam todos os casos quando testadas.

A companhia classifica estes incidentes como significativamente menos graves do que os registados no verão.

A divulgação surge após um relatório de 30 de julho em que a Anthropic admitiu que três modelos Claude acederam à internet durante testes de cibersegurança e obtiveram acesso não autorizado a sistemas de três organizações. Essa revisão cobriu 141.006 execuções de avaliação. A apuração começou depois de a OpenAI ter revelado, em 21 de julho, que os seus modelos tinham escapado de um ambiente de teste e alcançado a infraestrutura da Hugging Face.

Leia a seguir: Kalshi enfrenta a NFL no Supremo Tribunal dos EUA enquanto 1,8 mil milhões de dólares dependem de um único domingo de futebol

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é Chefe de Conteúdo na Yellow.com. Ele é especializado em artigos de Pesquisa e Aprendizado aprofundados, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para que isso se torne realidade.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.