Belangrijkste punten
Anthropic heeft onderzoek gepubliceerd naar Claude, dat geautomatiseerd alignment-werk uitvoert. Claude verbeterde de veiligheidsscores op tien geteste alignment-fouten. Volgens Anthropic bleven de algemene capaciteiten van de modellen in de tests behouden. Het bedrijf stelde de geautomatiseerde alignment-omgeving beschikbaar voor andere onderzoekers.
Anthropic meldt dat Claude via een geautomatiseerd onderzoeksproces de veiligheidsscores op tien typen alignment-fouten heeft verbeterd. Volgens het bedrijf bleef de algemene performance van de modellen intact, terwijl onderzoekers verschillende veiligheidsinterventies evalueerden.
In een bericht geeft Anthropic aan dat het zijn geautomatiseerde alignment-omgeving nu ook openstelt voor externe onderzoekers. Het bedrijf positioneert het werk als een poging om modelmisalignment beter te meten en te beperken.
Claude test veiligheidsinterventies
Anthropic zegt dat Claude veelvoorkomende vormen van misalignment onderzocht, zoals misleiding en overdreven inschikkelijkheid richting de gebruiker. Het model stelde aanpakken voor, trainde kleinere modellen en beoordeelde de uitkomsten, zonder dat er per stap direct menselijk werd bijgestuurd.
In een vroege proef kreeg Claude 48 uur rekentijd en toegang tot één grafische processor. In die periode onderzocht het verschillende methoden, stelde het trainingsstrategieën voor en testte het de resulterende modellen.
Volgens Anthropic wist Claude de veiligheidsscore te verhogen zonder de algemene capaciteiten van de modellen in deze setting aantoonbaar te verslechteren. Sommige methoden bleken bovendien overdraagbaar naar benchmarks die niet waren gebruikt tijdens de optimalisatie.
De onderzoekers melden dat hun aanpak generaliseert naar de Petri behavioral audit. Ook zouden in de tests modellen zijn meegenomen die tot 4,7 keer groter zijn dan de modellen die in het initiële onderzoekstraject zijn gebruikt.
De resultaten gelden voor gecontroleerde testomgevingen. Anthropic benadrukt dat subtiele of uiterst zeldzame fouten mogelijk niet zichtbaar worden in de huidige benchmarks.
Ook interessant: TRON-upgrade voegt P-256-verificatie en langere blockhistorie toe
AI-alignment wordt geautomatiseerd
Tot nu toe leunde alignment-onderzoek vooral op menselijke experts, die interventies ontwierpen en modellen beoordeelden. Als de resultaten stand houden onder onafhankelijke toetsing, kunnen geautomatiseerde systemen dat proces aanzienlijk verkorten.
De afgelopen 30 dagen is in de AI-veiligheidsdiscussie vaker de vraag opgekomen of krachtigere modellen kunnen helpen bij het testen en verbeteren van zwakkere systemen.
Zo’n aanpak valt of staat met betrouwbare metingen en bescherming tegen misleidende benchmarkprestaties. Anthropic zegt dat het in het experiment zogenoemde held-out tests gebruikte om te toetsen of de methoden verder reikten dan de benchmarks waarop Claude zelf had geoptimaliseerd. Het bedrijf claimt nadrukkelijk niet dat goede benchmarkresultaten elk modelrisico uitsluiten.
Anthropic onderstreept dat de keuze voor de juiste meetmethoden cruciaal blijft in dit onderzoeksveld.
Onderzoekers van buiten kunnen de omgeving gebruiken
Anthropic heeft de onderzoeksomgeving vrijgegeven zodat andere partijen de experimenten kunnen reproduceren of uitbreiden. Onafhankelijke tests moeten uitwijzen of de aanpak ook werkt voor andere modeltypen en veiligheidsbeoordelingen.
Het bedrijf presenteert de bevindingen niet als vervanging van brede modelevaluaties. De gerapporteerde resultaten zijn beperkt tot de geteste alignment-fouten en de gekozen experimentele randvoorwaarden.
Vervolgonderzoek zal zich naar verwachting richten op reproduceerbaarheid, benchmarkontwerp en mogelijke faalmodi. De publicatie van Anthropic biedt daarvoor een concreet raamwerk.
Lees ook: Fomo-copytrading bezorgt bijna 94% van de wallets verlies: onderzoek

