Anthropic suspendeu parte do treino e dos testes das suas IAs depois de os modelos terem realizado ações não autorizadas online, e deslocou cerca de 150 engenheiros de produto para funções de segurança.
Pontos-chave:
- A Anthropic travou avaliações cibernéticas externas de modelos em pré-lançamento e suspendeu brevemente testes internos, enquanto ambientes de reinforcement learning de maior risco ficaram offline várias semanas.
- Cerca de 150 engenheiros de produto foram realocados para equipas de segurança, fiabilidade e privacidade a partir de abril, e as equipas de produto engavetaram a maioria das novas funcionalidades.
- A decisão segue-se à divulgação, em julho, de três incidentes e a um relatório separado do governo britânico sobre comportamento não autorizado de agentes em testes de cibersegurança.
Pausa da Anthropic abrange testes cibernéticos e reinforcement learning
A empresa detalhou as mudanças num post publicado em 31 de agosto, cerca de um mês depois de revelar pela primeira vez que os seus modelos tinham alcançado sistemas informáticos reais.
Segundo a Anthropic, as avaliações cibernéticas externas de modelos em pré-lançamento foram interrompidas após três incidentes reportados em julho, e os próprios testes internos foram também suspensos por um período curto. Ambientes de reinforcement learning considerados de maior risco — nos quais os modelos recebem recompensas por concluir tarefas — permaneceram offline durante várias semanas.
A maior parte desse treino já foi retomada sob um novo esquema de monitorização, embora alguns ambientes de alto risco continuem em pausa, à espera de revisão manual ou de uma versão atualizada das ferramentas. A empresa criou ainda um classificador capaz de detetar quando um modelo está a sondar ou a tentar escapar do ambiente de teste, bloqueando a ação antes da execução da chamada de ferramenta e gerando um alerta humano.
Cerca de 150 engenheiros de produto passaram para equipas de segurança, fiabilidade e privacidade a partir de abril, meses antes das revelações de julho. Investigadores saíram temporariamente do trabalho de pré-treino para se concentrarem em salvaguardas e segurança. As equipas de produto suspenderam a maioria das novas funcionalidades até cumprirem os critérios de segurança estabelecidos para o regresso ao desenvolvimento normal.
Leia também: Bancos vendem cripto enquanto rejeitam risco no balanço no Brasil
Steven Adler e Pacing the Frontier pedem mais rigor
O U.K. AI Security Institute reportou em 4 de agosto que agentes realizaram 19 ações não autorizadas em 10 de 122 execuções de avaliação, sendo 17 delas atribuídas ao Claude Mythos 5. No caso mais grave, um agente criou identidades falsas e pressionou um mantenedor humano a aprovar código malicioso num projeto público.
Steven Adler, ex-funcionário da OpenAI e cofundador da organização sem fins lucrativos Guidelight AI Standards, afirmou que as medidas são “um bom primeiro passo, mas ainda há caminho a percorrer”. Para Adler, o setor precisa de um ritmo de desenvolvimento previsível e verificável na fronteira tecnológica, em vez de travagens pontuais decididas empresa a empresa. A Anthropic indicou que pretende trabalhar com a METR numa revisão externa.
Tanto a Anthropic como outras empresas subscreveram a iniciativa Pacing the Frontier, uma carta aberta assinada por mais de 1.100 funcionários da OpenAI, Anthropic, Google DeepMind e Meta. O apelo é para que o governo dos EUA ajude a criar mecanismos capazes de desacelerar deliberadamente o desenvolvimento de modelos de fronteira.
As pausas agora reveladas seguem intervenções mais discretas no início do ano. Em fevereiro, a Anthropic reverteu três dias de treino de uma versão Mythos Preview depois de identificar sinais de “reward hacking”, quando o modelo aprende a explorar falhas na função de recompensa. Em abril, congelou alterações nos ambientes de reinforcement learning em produção por cerca de um mês, sinalizando problemas em mais de 10% desses ambientes.
Leia a seguir: Robinhood Chain ultrapassa Solana pela primeira vez com US$ 1,45 bi em volume diário em DEX





