Belangrijkste punten
Anthropic publiceert onderzoek naar Claude als geautomatiseerd alignment-systeem.
Claude verhoogt veiligheidscores op tien geteste alignment-fouten.
Volgens Anthropic blijven de algemene capaciteiten van de modellen behouden.
Het bedrijf stelt de geautomatiseerde alignment-omgeving beschikbaar voor derden.
Anthropic meldt dat Claude via een geautomatiseerd onderzoeksproces de veiligheidscores op tien typen alignment-fouten heeft verbeterd. Volgens het bedrijf bleven de algemene modelcapaciteiten in stand, terwijl onderzoekers verschillende veiligheidsinterventies evalueerden.
In een bericht laat Anthropic weten dat het zijn geautomatiseerde alignment-onderzoeksomgeving nu ook opent voor externe onderzoekers. Het bedrijf presenteert het werk als een poging om modelmisalignment beter te meten en terug te dringen.
Claude test veiligheidsinterventies
Volgens Anthropic onderzocht Claude veelvoorkomende vormen van misalignment, waaronder misleiding en overmatig meegaand gedrag (sycophancy). Het model stelde interventies voor, trainde kleinere modellen en beoordeelde zelf de resultaten, zonder directe menselijke sturing bij elke stap.
In een vroeg experiment kreeg Claude 48 uur rekentijd en één GPU toegewezen. In die periode onderzocht het model mogelijke aanpakken, ontwierp trainingsmethodes en testte de resulterende modellen.
Anthropic stelt dat Claude de veiligheidscores wist op te voeren zonder de algemene capaciteiten in de gebruikte tests waarneembaar te verslechteren. Bepaalde methodes bleken bovendien overdraagbaar naar benchmarks die niet voor de optimalisatie waren gebruikt.
De onderzoekers melden dat hun aanpak generaliseert naar de Petri behavioral audit. Ook zouden de tests modellen omvatten die tot 4,7 keer zo groot zijn als de modellen die tijdens het onderzoekstraject zelf werden ingezet.
De resultaten hebben uitsluitend betrekking op gecontroleerde testomgevingen. Anthropic benadrukt dat subtiele of zeldzame fouten mogelijk niet zichtbaar worden in de huidige benchmarks.
Ook lezen: TRON-upgrade voegt P-256-verificatie en langere blokgeschiedenis toe
AI-alignment wordt geautomatiseerd
Tot nu toe leunde alignment-onderzoek grotendeels op menselijke experts die interventies ontwierpen en modellen beoordeelden. Als de nieuwe aanpak standhoudt onder onafhankelijke toetsing, kunnen geautomatiseerde systemen dat proces aanzienlijk verkorten.
De afgelopen 30 dagen richt het debat over AI-veiligheid zich in toenemende mate op de vraag of krachtigere modellen kunnen helpen om zwakkere systemen te beoordelen en te verbeteren.
Die strategie valt of staat met betrouwbare metingen en bescherming tegen misleidende benchmarkresultaten. Anthropic schrijft dat in het experiment aparte, niet-gebruikte tests zijn ingezet om te zien in hoeverre de methodes buiten de door Claude geoptimaliseerde benchmarks generaliseren. Het bedrijf claimt nadrukkelijk niet dat goede benchmarkcijfers alle modelrisico’s wegnemen.
Anthropic onderstreept dat de keuze van de juiste meetmethodes cruciaal blijft voor dit soort werk.
Buitenstaanders kunnen de omgeving gebruiken
Anthropic stelt de onderzoeksomgeving beschikbaar zodat andere partijen de experimenten kunnen reproduceren of uitbreiden. Onafhankelijke tests moeten uitwijzen of de aanpak overeind blijft bij andere modellen en bij alternatieve veiligheidsbeoordelingen.
Het bedrijf presenteert de resultaten niet als vervanging voor bredere modelaudits. De bevindingen gelden uitsluitend voor de geteste alignment-fouten en de gehanteerde experimentele randvoorwaarden.
Onderzoekers zullen zich waarschijnlijk richten op replicatie, benchmark-ontwerp en mogelijke faalmodi. Met de publicatie van de onderzoeksopzet biedt Anthropic een raamwerk voor dat vervolgwerk.
Lees ook: Fomo-copytrading bezorgt bijna 94% van wallets verlies: onderzoek





