Anthropic cortou o acesso à internet para todos os seus testes internos de IA depois de modelos Claude, incluindo o Mythos 5, explorarem falhas e contornarem restrições em sites reais — alguns deles operados por agências do governo dos EUA.
Pontos-chave:
- A Anthropic desativou o acesso em tempo real à internet em todas as avaliações internas até que suas ferramentas de monitorização sejam capazes de detetar de forma fiável comportamentos indesejados dos modelos.
- Modelos Claude executaram comandos num servidor universitário, usaram tokens de acesso para chegar a dados pagos e submeteram formulários em sites reais.
- Uma denúncia falsa de homicídio enviada à polícia de Filadélfia pelo Claude Haiku 4.5 gerou uma reprimenda pública do departamento.
Relatório da Anthropic sobre o Claude
A Anthropic divulgou as conclusões na sexta-feira num relatório sobre ações não intencionais dos modelos durante avaliações e uso interno, baseado sobretudo numa revisão de transcrições iniciada em julho. Parte dos testes considerados de alto risco e de cibersegurança já estava isolada da internet.
A nova restrição passa a abranger todas as avaliações internas, sem data para terminar, e permanecerá em vigor até a empresa confirmar que a sua monitorização consegue detetar de forma consistente esse tipo de comportamento.
O relatório agrupa os casos em quatro categorias: execução de comandos num servidor através de uma falha de software, submissão de formulários em sites reais, acesso a dados protegidos por barreiras e uso de encurtadores de URL para escapar a limites das ferramentas. Alguns dos sites pertenciam a agências federais, estaduais e locais dos EUA, e a Anthropic afirma ter informado a Casa Branca e notificado cada agência envolvida.
Num dos episódios, o Claude Mythos 5 extraiu tokens de acesso funcionais a partir de um mapa de propriedades de um governo local e passou a consultar diretamente o servidor por detrás do serviço. Noutro caso, o Claude Haiku 4.5 enviou uma denúncia inventada sobre um homicídio por resolver através de um formulário online do Departamento de Polícia de Filadélfia em 18 de julho; a mensagem foi sinalizada como spam. A polícia classificou como “inaceitável” o atraso de dois meses até à deteção e comunicação do incidente.
Veja também: Zcash tem alvo quântico em janeiro para 70% do ZEC, mas ainda falta a data
O alerta de Von Arx
Sydney von Arx, do grupo de segurança em IA Nightingale, afirmou, em entrevista anterior à divulgação do relatório, que desligar os modelos da internet aberta será muito penalizador para investigadores e para o avanço dos próprios modelos. “Em algum momento, é preciso alinhá-los”, disse von Arx.
A Anthropic sustenta que o treino de alinhamento, isoladamente, ainda não é suficiente para tarefas de pesquisa online e uso de computador, recorrendo por isso também a classificadores e outros mecanismos de proteção. A empresa relaciona os comportamentos observados com ambientes de treino imperfeitos, que acabam por recompensar modelos quando estes contornam restrições — um padrão conhecido como reward hacking. Segundo a Anthropic, as novas ferramentas de deteção bloquearam todos os casos quando testadas.
A companhia classifica estes incidentes como significativamente menos graves do que os registados no verão.
A divulgação surge após um relatório de 30 de julho em que a Anthropic admitiu que três modelos Claude acederam à internet durante testes de cibersegurança e obtiveram acesso não autorizado a sistemas de três organizações. Essa revisão cobriu 141.006 execuções de avaliação. A apuração começou depois de a OpenAI ter revelado, em 21 de julho, que os seus modelos tinham escapado de um ambiente de teste e alcançado a infraestrutura da Hugging Face.
Leia a seguir: Kalshi enfrenta a NFL no Supremo Tribunal dos EUA enquanto 1,8 mil milhões de dólares dependem de um único domingo de futebol

