Anthropic meldt dat Claude minder alignment-fouten maakt in geautomatiseerde tests

Anthropic meldt dat Claude minder alignment-fouten maakt in geautomatiseerde tests
Anthropic Publishes Automated Alignment Research Setup for Outside Use (Image: AI)

Belangrijkste punten

Anthropic publiceert onderzoek naar Claude als geautomatiseerd alignment-systeem.
Claude verhoogt veiligheidscores op tien geteste alignment-fouten.
Volgens Anthropic blijven de algemene capaciteiten van de modellen behouden.
Het bedrijf stelt de geautomatiseerde alignment-omgeving beschikbaar voor derden.

Anthropic meldt dat Claude via een geautomatiseerd onderzoeksproces de veiligheidscores op tien typen alignment-fouten heeft verbeterd. Volgens het bedrijf bleven de algemene modelcapaciteiten in stand, terwijl onderzoekers verschillende veiligheidsinterventies evalueerden.

In een bericht laat Anthropic weten dat het zijn geautomatiseerde alignment-onderzoeksomgeving nu ook opent voor externe onderzoekers. Het bedrijf presenteert het werk als een poging om modelmisalignment beter te meten en terug te dringen.

Claude test veiligheidsinterventies

Volgens Anthropic onderzocht Claude veelvoorkomende vormen van misalignment, waaronder misleiding en overmatig meegaand gedrag (sycophancy). Het model stelde interventies voor, trainde kleinere modellen en beoordeelde zelf de resultaten, zonder directe menselijke sturing bij elke stap.

In een vroeg experiment kreeg Claude 48 uur rekentijd en één GPU toegewezen. In die periode onderzocht het model mogelijke aanpakken, ontwierp trainingsmethodes en testte de resulterende modellen.

Anthropic stelt dat Claude de veiligheidscores wist op te voeren zonder de algemene capaciteiten in de gebruikte tests waarneembaar te verslechteren. Bepaalde methodes bleken bovendien overdraagbaar naar benchmarks die niet voor de optimalisatie waren gebruikt.

De onderzoekers melden dat hun aanpak generaliseert naar de Petri behavioral audit. Ook zouden de tests modellen omvatten die tot 4,7 keer zo groot zijn als de modellen die tijdens het onderzoekstraject zelf werden ingezet.

De resultaten hebben uitsluitend betrekking op gecontroleerde testomgevingen. Anthropic benadrukt dat subtiele of zeldzame fouten mogelijk niet zichtbaar worden in de huidige benchmarks.

Ook lezen: TRON-upgrade voegt P-256-verificatie en langere blokgeschiedenis toe

AI-alignment wordt geautomatiseerd

Tot nu toe leunde alignment-onderzoek grotendeels op menselijke experts die interventies ontwierpen en modellen beoordeelden. Als de nieuwe aanpak standhoudt onder onafhankelijke toetsing, kunnen geautomatiseerde systemen dat proces aanzienlijk verkorten.

De afgelopen 30 dagen richt het debat over AI-veiligheid zich in toenemende mate op de vraag of krachtigere modellen kunnen helpen om zwakkere systemen te beoordelen en te verbeteren.

Die strategie valt of staat met betrouwbare metingen en bescherming tegen misleidende benchmarkresultaten. Anthropic schrijft dat in het experiment aparte, niet-gebruikte tests zijn ingezet om te zien in hoeverre de methodes buiten de door Claude geoptimaliseerde benchmarks generaliseren. Het bedrijf claimt nadrukkelijk niet dat goede benchmarkcijfers alle modelrisico’s wegnemen.

Anthropic onderstreept dat de keuze van de juiste meetmethodes cruciaal blijft voor dit soort werk.

Buitenstaanders kunnen de omgeving gebruiken

Anthropic stelt de onderzoeksomgeving beschikbaar zodat andere partijen de experimenten kunnen reproduceren of uitbreiden. Onafhankelijke tests moeten uitwijzen of de aanpak overeind blijft bij andere modellen en bij alternatieve veiligheidsbeoordelingen.

Het bedrijf presenteert de resultaten niet als vervanging voor bredere modelaudits. De bevindingen gelden uitsluitend voor de geteste alignment-fouten en de gehanteerde experimentele randvoorwaarden.

Onderzoekers zullen zich waarschijnlijk richten op replicatie, benchmark-ontwerp en mogelijke faalmodi. Met de publicatie van de onderzoeksopzet biedt Anthropic een raamwerk voor dat vervolgwerk.

Lees ook: Fomo-copytrading bezorgt bijna 94% van wallets verlies: onderzoek

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza is een ervaren financieel journalist met uitgebreide ervaring in het verslaan van cryptovaluta en blockchaintechnologie. Hij heeft bijgedragen aan Benzinga en Cointelegraph, naast andere publicaties, waar hij verslag uitbracht over opkomende trends, het regelgevend landschap en meer. Je vindt hem op Twitter als @murtuza_merc en op Telegram als mmerchant001. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
Anthropic meldt dat Claude minder alignment-fouten maakt in geautomatiseerde tests | Yellow