Punti chiave
Anthropic pubblica una ricerca su Claude per l’allineamento automatizzato. Claude alza i punteggi di sicurezza in 10 casi di fallimento di allineamento. Secondo Anthropic, le capacità generali del modello restano inalterate. Il gruppo rilascia una piattaforma di ricerca per l’allineamento automatizzato.
Anthropic sostiene che Claude abbia migliorato gli indici di sicurezza in 10 scenari di fallimento di allineamento sottoposti a test, tramite un processo di ricerca completamente automatizzato. Il gruppo afferma che, durante le prove, le capacità generali dei modelli siano state preservate mentre i ricercatori valutavano diversi interventi di sicurezza.
In un post, Anthropic ha annunciato di aver reso disponibile all’esterno il proprio setup di ricerca per l’allineamento automatizzato. L’iniziativa è descritta come un tentativo strutturato di misurare e mitigare la disallineamento dei modelli.
Claude mette alla prova gli interventi di sicurezza
Anthropic riferisce che Claude ha analizzato alcune forme tipiche di disallineamento, tra cui tendenze alla dissimulazione e compiacenza acritica verso l’utente. Il modello ha proposto metodi di intervento, addestrato modelli più piccoli e valutato i risultati, il tutto senza supervisione diretta passo per passo.
In un primo esperimento, Claude ha avuto a disposizione 48 ore e una singola GPU. In quel lasso di tempo ha esplorato diversi approcci, proposto strategie di training e testato le performance dei modelli risultanti.
Secondo Anthropic, Claude è riuscito a incrementare i punteggi di sicurezza senza compromettere le capacità generali nelle configurazioni testate. Alcuni dei metodi messi a punto si sarebbero inoltre trasferiti con successo a benchmark non utilizzati in fase di ottimizzazione.
L’azienda segnala che le sue procedure si sono generalizzate anche al Petri behavioral audit, un protocollo di audit comportamentale. Anthropic aggiunge che i test hanno incluso modelli fino a 4,7 volte più grandi rispetto a quelli impiegati nel processo di ricerca iniziale.
I risultati restano comunque circoscritti ad ambienti di test misurabili. Anthropic avverte che fallimenti rari o particolarmente sottili potrebbero non emergere negli attuali benchmark disponibili.
Da leggere anche: Aggiornamento TRON: arriva la verifica P-256 e una cronologia dei blocchi più estesa
L’allineamento AI diventa automatizzato
Prima di questa pubblicazione, il lavoro di allineamento si basava in larga misura su ricercatori umani incaricati di progettare gli interventi e valutare i modelli. Sistemi automatizzati potrebbero abbreviare sensibilmente il ciclo di ricerca, a condizione che i risultati reggano a valutazioni indipendenti.
Negli ultimi 30 giorni, il dibattito sulla sicurezza dell’AI si è concentrato sempre di più sull’idea che modelli più potenti possano contribuire a valutare e migliorare sistemi più deboli.
Questo approccio dipende però da misurazioni affidabili e da adeguate protezioni contro performance fuorvianti sui benchmark.
Anthropic segnala che il proprio esperimento ha utilizzato test “held-out” per verificare se i metodi si generalizzassero oltre i benchmark su cui Claude aveva effettuato l’ottimizzazione. L’azienda non sostiene che i risultati sui benchmark siano sufficienti a eliminare ogni forma di rischio di modello.
Il gruppo sottolinea che la scelta delle metriche e degli indicatori corretti resta centrale per l’intero lavoro.
Setup aperto ai ricercatori esterni
Anthropic ha rilasciato il setup di ricerca per consentire ad altri gruppi di replicare o estendere gli esperimenti. Saranno test indipendenti a chiarire se i metodi funzionino in modo altrettanto efficace su modelli diversi e in differenti valutazioni di sicurezza.
L’azienda non presenta queste evidenze come sostitutive di valutazioni più ampie sui modelli. I risultati dichiarati restano limitati ai fallimenti di allineamento analizzati e ai vincoli sperimentali adottati.
I prossimi lavori dei ricercatori si concentreranno probabilmente su replicazione, progettazione dei benchmark e analisi delle possibili modalità di fallimento. La pubblicazione di Anthropic fornisce un quadro operativo per questo tipo di studi.
Da leggere dopo: Il Fomo copy trading ha lasciato quasi il 94% dei wallet in perdita: studio

