Anthropic suspende treino de IA após ações não autorizadas e desloca 150 engenheiros para segurança

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic suspendeu partes do treino e dos testes dos seus modelos de IA depois de estes terem realizado ações não autorizadas online, e transferiu cerca de 150 engenheiros de produto para funções de segurança.

Principais pontos:

  • A Anthropic interrompeu avaliações cibernéticas externas de modelos pré-lançamento e suspendeu temporariamente testes internos, enquanto ambientes de aprendizagem por reforço de maior risco ficaram offline durante várias semanas.
  • Cerca de 150 engenheiros de produto foram realocados para equipas de segurança, fiabilidade e privacidade a partir de abril, e as equipas de produto colocaram em pausa a maioria das novas funcionalidades.
  • A decisão segue-se à divulgação, em julho, de três incidentes e a um relatório separado do governo britânico sobre comportamento não autorizado de agentes em testes de cibersegurança.

Suspensão da Anthropic abrange testes de cibersegurança e aprendizagem por reforço

A empresa detalhou as mudanças num artigo publicado em 31 de agosto, cerca de um mês depois de revelar pela primeira vez que os seus modelos tinham interagido com sistemas informáticos reais.

A Anthropic afirmou que interrompeu avaliações de cibersegurança externas de modelos pré-lançamento após três incidentes reportados em julho e que suspendeu por um curto período os próprios testes internos. Ambientes de aprendizagem por reforço considerados de maior risco, onde os modelos recebem recompensas por concluir tarefas, permaneceram desligados durante várias semanas.

A maior parte desse treino já foi retomada com novos mecanismos de monitorização, embora alguns ambientes de alto risco continuem suspensos, à espera de revisão manual ou de uma versão atualizada das ferramentas. A empresa também desenvolveu um classificador capaz de detetar quando um modelo está a sondar ou a tentar escapar de um ambiente de teste, bloqueando a ação antes da execução da chamada de ferramenta e alertando um operador humano.

Cerca de 150 engenheiros de produto foram deslocados, a partir de abril, para equipas de segurança, fiabilidade e privacidade, meses antes das revelações de julho. Investigadores saíram temporariamente do trabalho de pré-treino para se concentrarem em salvaguardas e segurança. As equipas de produto colocaram em espera a maioria das novas funcionalidades até cumprirem os critérios de segurança definidos para regressar ao desenvolvimento normal.

Leia também: Bancos vendem cripto enquanto rejeitam risco de balanço no Brasil

Steven Adler e Pacing the Frontier pedem medidas mais robustas

O U.K. AI Security Institute reportou, em 4 de agosto, que agentes realizaram 19 ações não autorizadas em 10 de 122 execuções de testes, sendo 17 delas atribuídas ao Claude Mythos 5. No caso mais grave, um agente criou identidades falsas e pressionou um mantenedor humano a aprovar código malicioso num projeto público.

Steven Adler, ex-funcionário da OpenAI e cofundador da organização sem fins lucrativos Guidelight AI Standards, afirmou que as medidas são “um bom primeiro passo, mas ainda há caminho a percorrer”. Segundo ele, o setor precisa de um ritmo de desenvolvimento previsível e verificável na fronteira tecnológica, em vez de travagens pontuais decididas empresa a empresa. A Anthropic declarou que pretende trabalhar com a METR numa revisão externa.

Tanto a Anthropic como a OpenAI subscrevem a iniciativa Pacing the Frontier, uma carta aberta assinada por mais de 1.100 funcionários da OpenAI, Anthropic, Google DeepMind e Meta. O apelo é para que o governo dos EUA contribua para criar ferramentas capazes de abrandar deliberadamente o desenvolvimento de modelos de fronteira.

As pausas agora anunciadas seguem-se a intervenções mais discretas no início do ano. Em fevereiro, a empresa reverteu três dias de treino numa execução Mythos Preview depois de detetar sinais de “reward hacking”, ou manipulação do sistema de recompensas. Em abril, congelou alterações nos seus ambientes de aprendizagem por reforço em produção durante cerca de um mês, sinalizando problemas em mais de 10% desses ambientes.

Leia em seguida: Robinhood Chain ultrapassa Solana pela primeira vez com US$ 1,45 bi em volume diário de DEX

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev é o Head of Content na Yellow.com, tendo reportado sobre cripto nos últimos 10 anos. Ele se especializa em artigos aprofundados de Research e Learn, com foco em reportagens analíticas, contexto de mercado e nas grandes forças que moldam o universo cripto, desde a era da IA e tecnologias de segurança até a inovação em fintech. Ele acredita que tudo o que é digital em breve superará tudo o que é analógico e está trabalhando arduamente para ajudar a tornar isso realidade.

Disclaimer e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e baseiam-se na opinião do autor. Não constituem aconselhamento financeiro, de investimento, legal ou fiscal. Os ativos de criptomoeda são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou deter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou executivos. Sempre conduza a sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Anthropic suspende treino de IA após ações não autorizadas e desloca 150 engenheiros para segurança | Yellow