Anthropic meldt dat Claude minder alignment-fouten maakt in geautomatiseerde tests

Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)
Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)

Belangrijkste punten

Anthropic heeft onderzoek gepubliceerd naar Claude, dat geautomatiseerd alignment-werk uitvoert. Claude verbeterde de veiligheids­scores op tien geteste alignment-fouten. Volgens Anthropic bleven de algemene capaciteiten van de modellen in de tests behouden. Het bedrijf stelde de geautomatiseerde alignment-omgeving beschikbaar voor andere onderzoekers.

Anthropic meldt dat Claude via een geautomatiseerd onderzoeksproces de veiligheids­scores op tien typen alignment-fouten heeft verbeterd. Volgens het bedrijf bleef de algemene performance van de modellen intact, terwijl onderzoekers verschillende veiligheids­interventies evalueerden.

In een bericht geeft Anthropic aan dat het zijn geautomatiseerde alignment-omgeving nu ook openstelt voor externe onderzoekers. Het bedrijf positioneert het werk als een poging om modelmisalignment beter te meten en te beperken.

Claude test veiligheids­interventies

Anthropic zegt dat Claude veelvoorkomende vormen van misalignment onderzocht, zoals misleiding en overdreven inschikkelijkheid richting de gebruiker. Het model stelde aanpakken voor, trainde kleinere modellen en beoordeelde de uitkomsten, zonder dat er per stap direct menselijk werd bijgestuurd.

In een vroege proef kreeg Claude 48 uur rekentijd en toegang tot één grafische processor. In die periode onderzocht het verschillende methoden, stelde het trainingsstrategieën voor en testte het de resulterende modellen.

Volgens Anthropic wist Claude de veiligheids­score te verhogen zonder de algemene capaciteiten van de modellen in deze setting aantoonbaar te verslechteren. Sommige methoden bleken bovendien overdraagbaar naar benchmarks die niet waren gebruikt tijdens de optimalisatie.

De onderzoekers melden dat hun aanpak generaliseert naar de Petri behavioral audit. Ook zouden in de tests modellen zijn meegenomen die tot 4,7 keer groter zijn dan de modellen die in het initiële onderzoekstraject zijn gebruikt.

De resultaten gelden voor gecontroleerde testomgevingen. Anthropic benadrukt dat subtiele of uiterst zeldzame fouten mogelijk niet zichtbaar worden in de huidige benchmarks.

Ook interessant: TRON-upgrade voegt P-256-verificatie en langere blockhistorie toe

AI-alignment wordt geautomatiseerd

Tot nu toe leunde alignment-onderzoek vooral op menselijke experts, die interventies ontwierpen en modellen beoordeelden. Als de resultaten stand houden onder onafhankelijke toetsing, kunnen geautomatiseerde systemen dat proces aanzienlijk verkorten.

De afgelopen 30 dagen is in de AI-veiligheids­discussie vaker de vraag opgekomen of krachtigere modellen kunnen helpen bij het testen en verbeteren van zwakkere systemen.

Zo’n aanpak valt of staat met betrouwbare metingen en bescherming tegen misleidende benchmarkprestaties. Anthropic zegt dat het in het experiment zogenoemde held-out tests gebruikte om te toetsen of de methoden verder reikten dan de benchmarks waarop Claude zelf had geoptimaliseerd. Het bedrijf claimt nadrukkelijk niet dat goede benchmarkresultaten elk modelrisico uitsluiten.

Anthropic onderstreept dat de keuze voor de juiste meetmethoden cruciaal blijft in dit onderzoeksveld.

Onderzoekers van buiten kunnen de omgeving gebruiken

Anthropic heeft de onderzoeksomgeving vrijgegeven zodat andere partijen de experimenten kunnen reproduceren of uitbreiden. Onafhankelijke tests moeten uitwijzen of de aanpak ook werkt voor andere modeltypen en veiligheids­beoordelingen.

Het bedrijf presenteert de bevindingen niet als vervanging van brede model­evaluaties. De gerapporteerde resultaten zijn beperkt tot de geteste alignment-fouten en de gekozen experimentele randvoorwaarden.

Vervolgonderzoek zal zich naar verwachting richten op reproduceerbaarheid, benchmarkontwerp en mogelijke faalmodi. De publicatie van Anthropic biedt daarvoor een concreet raamwerk.

Lees ook: Fomo-copytrading bezorgt bijna 94% van de wallets verlies: onderzoek

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza is een ervaren financieel journalist met uitgebreide ervaring in het verslaan van cryptovaluta en blockchaintechnologie. Hij heeft bijgedragen aan Benzinga en Cointelegraph, naast andere publicaties, waar hij verslag uitbracht over opkomende trends, het regelgevend landschap en meer. Je vindt hem op Twitter als @murtuza_merc en op Telegram als mmerchant001. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
Anthropic meldt dat Claude minder alignment-fouten maakt in geautomatiseerde tests | Yellow