Wichtigste Punkte
Anthropic hat Forschung zu automatisierter Alignment-Arbeit mit Claude veröffentlicht. Claude steigerte die Sicherheitswerte bei zehn getesteten Alignment-Fehlern. Anthropic betont, dass die allgemeinen Fähigkeiten der Modelle erhalten blieben. Das Unternehmen stellt ein automatisiertes Alignment-Setup für externe Forscher bereit.
Anthropic berichtet, dass Claude im Rahmen eines automatisierten Forschungsprozesses die Sicherheitswerte über zehn getestete Alignment-Fehler hinweg deutlich verbessert hat. Zugleich seien in den Tests die allgemeinen Fähigkeiten der Modelle erhalten geblieben, während Forscher unterschiedliche Sicherheitsmaßnahmen evaluierten.
In einem Beitrag erklärte Anthropic, man habe das automatisierte Alignment-Setup nun auch für externe Forscher verfügbar gemacht. Das Unternehmen beschreibt die Arbeit als Versuch, Fehlanpassungen von Modellen systematisch zu messen und zu verringern.
Claude testet Sicherheitsmaßnahmen
Laut Anthropic untersuchte Claude gängige Formen von Fehlanpassung, darunter Täuschung und übertriebene Gefälligkeit gegenüber Nutzern. Das Modell entwickelte Vorschläge, trainierte kleinere Modelle und bewertete deren Ergebnisse – ohne direkte Eingriffe der Forscher in die einzelnen Schritte.
Für ein frühes Experiment erhielt Claude 48 Stunden Rechenzeit auf einer Grafikkarte. In diesem Zeitraum analysierte das System verschiedene Ansätze, schlug Trainingsmethoden vor und testete die daraus resultierenden Modelle.
Anthropic zufolge steigerten die Eingriffe die Sicherheitswerte, ohne die allgemeinen Fähigkeiten der Modelle in den getesteten Konfigurationen zu verschlechtern. Teilweise übertrugen sich die erarbeiteten Methoden zudem auf Benchmarks, die nicht direkt für die Optimierung genutzt worden waren.
Nach Unternehmensangaben ließen sich die Methoden auch auf das Petri-Verhaltensaudit übertragen. Die Tests umfassten zudem Modelle, die bis zu 4,7-mal größer waren als jene, die im eigentlichen Forschungsprozess trainiert worden waren.
Die Ergebnisse beziehen sich auf klar abgegrenzte Testumgebungen. Anthropic warnt, dass sehr subtile oder seltene Fehler in den verfügbaren Benchmarks womöglich nicht erfasst werden.
Lesen Sie auch: TRON-Upgrade bringt P-256-Verifizierung und längere Block-Historie
Automatisiertes AI-Alignment
Bislang beruhte Alignment-Forschung in der Regel darauf, dass menschliche Experten Eingriffe entwarfen und Modelle manuell bewerteten. Automatisierte Systeme könnten diesen Prozess deutlich beschleunigen – vorausgesetzt, ihre Ergebnisse bestehen unabhängige Überprüfungen.
In den vergangenen 30 Tagen hat sich die Debatte zur AI-Sicherheit zunehmend darum gedreht, ob leistungsstärkere Modelle genutzt werden können, um schwächere Systeme zu testen und zu verbessern.
Dieser Ansatz setzt verlässliche Messgrößen und Schutzmechanismen voraus, um irreführende Benchmark-Ergebnisse zu vermeiden. Anthropic betont, das Experiment habe mit zurückgehaltenen Tests gearbeitet, um zu prüfen, ob sich die Methoden über jene Benchmarks hinaus verallgemeinern lassen, auf die Claude optimiert wurde. Das Unternehmen erhebt nicht den Anspruch, dass gute Benchmark-Werte sämtliche Modellrisiken ausschließen.
Entscheidend bleibe die Wahl der richtigen Messverfahren, so Anthropic.
Forschungssetup für externe Teams
Anthropic stellt das Forschungssetup nun anderen Gruppen zur Verfügung, damit sie die Experimente reproduzieren oder weiterentwickeln können. Unabhängige Tests sollen zeigen, ob die Methoden auch bei anderen Modellen und Sicherheitsbewertungen tragen.
Das Unternehmen präsentiert die Ergebnisse ausdrücklich nicht als Ersatz für umfassendere Modellprüfungen. Die berichteten Resultate beziehen sich auf konkrete, getestete Alignment-Fehler und die Bedingungen der jeweiligen Experimente.
In einem nächsten Schritt dürften Forscher sich vor allem auf Replikation, die Ausgestaltung neuer Benchmarks und potenzielle Fehlermodi konzentrieren. Die Veröffentlichung von Anthropic liefert dafür einen Rahmen.
Als Nächstes lesen: Fomo Copy Trading brachte fast 94 % der Wallets Verluste: Studie

