Anthropic diz que Claude reduziu falhas de alinhamento em testes automatizados

Anthropic diz que Claude reduziu falhas de alinhamento em testes automatizados
Anthropic Publishes Automated Alignment Research Setup for Outside Use (Image: AI)

Principais pontos

Anthropic divulgou pesquisa em que Claude conduz trabalho automatizado de alinhamento. Claude elevou pontuações de segurança em 10 falhas de alinhamento testadas. Anthropic afirma que as capacidades gerais foram preservadas nos testes. A empresa liberou sua estrutura de pesquisa de alinhamento automatizado para terceiros.

A Anthropic afirmou que o Claude melhorou as pontuações de segurança em 10 falhas de alinhamento avaliadas, usando um processo de pesquisa automatizado. Segundo a empresa, os testes preservaram as capacidades gerais do modelo enquanto pesquisadores analisavam intervenções de segurança.

Em uma publicação, a Anthropic disse ter aberto sua infraestrutura de pesquisa de alinhamento automatizado para pesquisadores externos. A companhia descreveu o trabalho como um esforço para medir e mitigar desalinhamentos de modelos.

Claude testa intervenções de segurança

A Anthropic informou que o Claude examinou formas comuns de desalinhamento, incluindo tendência à enganação e bajulação. O modelo propôs métodos, treinou modelos menores e avaliou os resultados sem intervenção humana direta em cada etapa.

A empresa disse que o Claude teve 48 horas e uma unidade de processamento gráfico (GPU) em um experimento inicial. Nesse intervalo, o sistema pesquisou abordagens, sugeriu métodos de treinamento e testou os modelos resultantes.

Segundo a Anthropic, o Claude aumentou as pontuações de segurança sem degradar as capacidades gerais nos cenários testados. A empresa também destacou que parte dos métodos se transferiu para benchmarks que não haviam sido usados no processo de otimização.

A companhia relatou que suas técnicas se generalizaram para a auditoria comportamental Petri. A Anthropic afirmou ainda que os testes incluíram modelos até 4,7 vezes maiores do que aqueles usados diretamente no processo de pesquisa.

Os resultados se referem a ambientes de teste controlados. A Anthropic advertiu que falhas sutis ou muito raras podem não aparecer nos benchmarks disponíveis.

Veja também: Atualização da TRON adiciona verificação P-256 e histórico de blocos mais longo

Alinhamento de IA entra em modo automatizado

Até a divulgação dessa pesquisa, o trabalho de alinhamento em geral dependia de pesquisadores humanos para desenhar intervenções e avaliar modelos. Sistemas automatizados podem encurtar esse ciclo, caso seus resultados se sustentem sob avaliação independente.

Nos últimos 30 dias, discussões sobre segurança em IA têm se concentrado cada vez mais na ideia de usar modelos mais poderosos para avaliar e aprimorar sistemas mais fracos.

Essa abordagem depende de métricas confiáveis e de proteções contra desempenho enganoso em benchmarks. A Anthropic disse que seu experimento utilizou testes reservados (held-out) para verificar se os métodos se generalizavam além dos benchmarks que o Claude otimizou. A empresa não afirma que bons resultados em benchmarks eliminem todos os riscos de modelo.

A companhia reforçou que a escolha das métricas certas continua sendo um ponto central do trabalho.

Estrutura aberta para pesquisadores externos

A Anthropic disponibilizou seu setup de pesquisa para que outros grupos possam reproduzir ou ampliar os experimentos. Testes independentes vão mostrar se os métodos funcionam em diferentes modelos e avaliações de segurança.

A empresa não apresenta as conclusões como substituto de avaliações amplas de modelos. O resultado reportado se limita às falhas de alinhamento testadas e às restrições do experimento.

Pesquisadores devem concentrar-se em replicação, desenho de benchmarks e identificação de possíveis modos de falha. A iniciativa da Anthropic oferece uma estrutura de referência para esses estudos.

Leia em seguida: Fomo no copy trading deixou quase 94% das carteiras no prejuízo, diz pesquisa

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza é um jornalista financeiro experiente, com ampla vivência na cobertura de criptomoedas e tecnologia blockchain. Ele já contribuiu para a Benzinga e a Cointelegraph, entre outras publicações, reportando sobre tendências emergentes, o cenário regulatório e muito mais. Você pode encontrá-lo em @murtuza_merc no Twitter e como mmerchant001 no Telegram. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Anthropic diz que Claude reduziu falhas de alinhamento em testes automatizados | Yellow