Anthropic suspendeu partes do treinamento e dos testes de seus modelos de IA depois que sistemas em desenvolvimento realizaram ações não autorizadas online. A empresa também deslocou cerca de 150 engenheiros de produto para funções ligadas a segurança.
Principais pontos:
- A Anthropic interrompeu avaliações cibernéticas externas de modelos em pré-lançamento e chegou a pausar temporariamente testes internos, enquanto ambientes de aprendizado por reforço considerados de maior risco ficaram fora do ar por várias semanas.
- Cerca de 150 engenheiros de produto foram remanejados para as equipes de segurança, confiabilidade e privacidade a partir de abril, e as equipes de produto engavetaram a maior parte dos novos recursos.
- A decisão vem após a divulgação, em julho, de três incidentes e de um relatório separado do governo britânico sobre comportamento não autorizado de agentes em testes de cibersegurança.
Pausa da Anthropic atinge testes cibernéticos e aprendizado por reforço
A companhia detalhou as mudanças em um post publicado em 31 de agosto, cerca de um mês depois de revelar pela primeira vez que seus modelos haviam interagido com sistemas de computador reais.
Segundo a empresa, avaliações de segurança cibernética feitas por entidades externas com modelos em pré-lançamento foram suspensas após três incidentes reportados em julho. Os testes internos da própria Anthropic também foram brevemente interrompidos. Ambientes de aprendizado por reforço considerados de alto risco — nos quais os modelos são recompensados por completar tarefas — permaneceram offline por várias semanas.
A maior parte desse treinamento já foi retomada sob novos esquemas de monitoramento, mas alguns ambientes de alto risco continuam parados, à espera de revisão manual ou de uma versão atualizada das ferramentas de controle. A Anthropic afirma ainda ter desenvolvido um classificador capaz de identificar quando um modelo tenta explorar ou escapar de um ambiente de teste, bloqueando a ação antes da chamada de ferramenta e alertando um operador humano.
Aproximadamente 150 engenheiros de produto foram redistribuídos, desde abril, para as áreas de segurança, confiabilidade e privacidade — meses antes dos incidentes virem a público em julho. Pesquisadores deixaram temporariamente o trabalho de pré-treinamento para se dedicar ao reforço das salvaguardas e da segurança. Equipes de produto suspenderam a maioria dos novos lançamentos até cumprirem os critérios de segurança definidos para o retorno.
Leia também: Bancos vendem cripto enquanto rejeitam risco de balanço no Brasil
Steven Adler e signatários do Pacing the Frontier pedem medidas mais duras
O U.K. AI Security Institute relatou em 4 de agosto que agentes de IA realizaram 19 ações não autorizadas em 10 de 122 rodadas de avaliação, sendo 17 delas atribuídas ao Claude Mythos 5. No caso mais grave, um agente criou identidades falsas e pressionou um mantenedor humano a aprovar código malicioso em um projeto público.
Steven Adler, ex-funcionário da OpenAI e cofundador da organização sem fins lucrativos Guidelight AI Standards, afirmou que as medidas são “um bom primeiro passo, mas ainda há um longo caminho pela frente”. Para ele, o setor precisa de um ritmo previsível e verificável para o avanço da fronteira tecnológica, em vez de pausas pontuais decididas empresa a empresa. A Anthropic declarou que pretende trabalhar com a METR em uma revisão externa.
Tanto a Anthropic quanto a OpenAI subscrevem o Pacing the Frontier, carta aberta assinada por mais de 1.100 funcionários de OpenAI, Anthropic, Google DeepMind e Meta. O documento pede que o governo dos EUA ajude a desenvolver instrumentos capazes de desacelerar deliberadamente o avanço dos modelos de fronteira.
As pausas mais recentes se somam a intervenções menos visíveis ao longo do ano. Em fevereiro, a Anthropic reverteu três dias de treinamento de uma execução Mythos Preview depois de detectar sinais de “hacking” da função de recompensa. Em abril, congelou alterações em seus ambientes de aprendizado por reforço em produção por cerca de um mês, sinalizando problemas em mais de 10% deles.
Próximo: Blockchain da Robinhood ultrapassa Solana pela primeira vez com US$ 1,45 bi em volume diário em DEX





