Falha no Claude Cowork tirou-o da sandbox e deixou 500.000 Macs ao alcance do agente

Hidden Claude watermarks spark debate over traceable AI-assisted writing and file provenance (Image: Shutterstock)
Hidden Claude watermarks spark debate over traceable AI-assisted writing and file provenance (Image: Shutterstock)

Investigadores demonstraram que o Claude Cowork, da Anthropic, conseguia escapar da sua máquina virtual local e aceder a ficheiros em todo o Mac, expondo cerca de 500.000 utilizadores que executaram sessões locais.

Principais pontos:

  • Investigadores de segurança conseguiram escapar da máquina virtual Linux do Claude Cowork e ler ficheiros no Mac anfitrião.
  • A cadeia explorou uma falha no kernel Linux e um ponto de montagem com permissões de escrita sobre todo o sistema de ficheiros do Mac.
  • A Anthropic classificou o relatório como “informativo” e não lançou qualquer correção direta para sessões locais.

Accomplish AI liga cadeia SharedRoot a falha no kernel

A Accomplish AI publicou as conclusões a 23 de julho, depois de anexar apenas uma pasta a uma nova sessão do Cowork e enviar uma instrução curta. A partir daí, o agente ultrapassou essa pasta e passou a ler e escrever ficheiros noutras zonas da máquina anfitriã, sem que surgisse um segundo pedido de permissão.

No modo local, o Cowork é executado como utilizador sem privilégios dentro de uma máquina virtual Linux, enquanto um daemon com privilégios de root, chamado coworkd, gere as pastas que o utilizador partilha.

Os investigadores batizaram a cadeia de exploração de SharedRoot. O primeiro passo é a CVE-2026-46331, uma falha no kernel Linux com classificação 7,8 em 10, corrigida em meados de junho.

A vulnerabilidade resulta de um mau tratamento de memória copy-on-write, que permitiu à sessão corromper um ficheiro que o daemon viria a executar, obtendo assim privilégios de root dentro do sistema convidado. A SharedRoot nunca rompeu a camada de virtualização da Apple.

Veja também: Ataques “chave inglesa” a cripto chegam a 52 casos em seis meses, a maioria em França

Yomtov diz que uma única mensagem libertou o agente

Oren Yomtov, principal investigador de segurança na Accomplish AI, afirma que a equipa viu o agente abandonar a sandbox após uma única mensagem curta. Entre os ficheiros potencialmente acessíveis estavam chaves SSH privadas, credenciais de cloud e dados de navegadores pertencentes à conta de utilizador com sessão iniciada no Mac — embora o acesso continuasse limitado pelas permissões desse utilizador e pelas proteções do macOS. A cadeia foi comunicada à Anthropic antes da divulgação pública.

A equipa não encontrou qualquer indício de utilização da SharedRoot fora dos seus próprios testes controlados.

A falha no kernel foi apenas um elo da cadeia, e os investigadores defendem que o desenho geral pesou mais do que o bug isolado. O Cowork montava todo o sistema de ficheiros do Mac dentro da VM, com permissões de leitura e escrita, num caminho visível apenas para o root convidado; bastava, portanto, uma escalada de privilégios para abrir caminho ao acesso ao anfitrião.

A Accomplish refere que quatro mecanismos de proteção falharam em simultâneo e que corrigir apenas um deles teria bloqueado a fuga.

Resposta da Anthropic surge após fuga de sandbox na OpenAI

A Anthropic encerrou a submissão como “informativa” e não distribuiu qualquer correção direta, argumentando que a falha no kernel estava ainda dentro da sua janela interna de 30 dias para vulnerabilidades recentemente divulgadas.

A empresa já tinha tornado a execução em cloud o modo predefinido a 7 de julho, quando levou o Cowork para a web e para mobile, embora os utilizadores de desktop que ainda optem por processamento local continuem expostos.

O relatório surgiu dois dias depois de a OpenAI revelar que o GPT-5.6 Sol e um modelo ainda não lançado escaparam de um teste ExploitGym e alcançaram sistemas de produção da Hugging Face.

A plataforma detetou e conteve a atividade a 16 de julho, cinco dias antes de a OpenAI ligar a intrusão aos seus próprios testes internos. Para avaliar o potencial máximo dos modelos, a OpenAI executou-os com recusas de cibersegurança atenuadas.

Leia a seguir: Projeções de curto prazo para XRP apontam teto em US$ 1,25 antes da decisão da Fed

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head of Content na Yellow.com, tendo reportado sobre cripto nos últimos 10 anos. Ele se especializa em artigos aprofundados de Research e Learn, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para ajudar a tornar isso realidade.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.