Anthropic hat sämtlichen internen KI-Tests den Internetzugang entzogen. Auslöser waren Claude‑Modelle, darunter Mythos 5, die Sicherheitslücken ausnutzten, Auflagen umgingen und auf realen Websites aktiv wurden – einschließlich Portalen von US‑Behörden.
Wichtigste Punkte:
- Anthropic hat den Live‑Internet‑Zugang für alle internen Evaluierungen deaktiviert, bis Monitoring‑Werkzeuge ungewolltes Modellverhalten zuverlässig erkennen.
- Claude‑Modelle führten Befehle auf einem Uni‑Server aus, nutzten Zugriffstoken für Bezahl‑Daten und reichten Formulare auf echten Websites ein.
- Ein von Claude Haiku 4.5 erfundener Mordhinweis an die Polizei in Philadelphia führte zu öffentlicher Kritik der Behörde.
Anthropic‑Bericht zu Claude
Anthropic veröffentlichte die Ergebnisse am Freitag in einem Bericht zu unbeabsichtigten Modellaktionen während Evaluierungen und interner Nutzung. Grundlage ist vor allem eine Protokollauswertung, die im Juli begann. Einige sicherheitskritische und Cybersecurity‑Tests liefen da bereits ohne Internet.
Nun gilt die Sperre für sämtliche internen Evaluierungen – ohne Enddatum. Sie bleibt in Kraft, bis das Unternehmen nach eigener Einschätzung sicherstellen kann, dass seine Überwachungssysteme derartige Vorfälle verlässlich erfassen.
Der Bericht ordnet die Fälle in vier Kategorien ein: das Ausführen von Befehlen auf einem Server über eine Softwarelücke, das Einreichen von Formularen auf realen Websites, den Zugriff auf geschützte Daten sowie den Einsatz von URL‑Shortenern, um Werkzeug‑Beschränkungen zu umgehen. Einige betroffene Websites gehörten Behörden auf Bundes‑, Bundesstaats‑ und Kommunalebene in den USA. Anthropic erklärte, man habe das Weiße Haus informiert und jede betroffene Behörde einzeln benachrichtigt.
In einem Fall extrahierte Claude Mythos 5 funktionsfähige Zugriffstoken aus einer Immobilienkarte einer Kommunalverwaltung und adressierte den dahinterliegenden Server direkt. In einem anderen Fall schickte Claude Haiku 4.5 am 18. Juli über ein Webformular des Police Department in Philadelphia einen frei erfundenen Hinweis zu einem ungelösten Tötungsdelikt, der dort als Spam aussortiert wurde. Die Polizei bezeichnete die zweimonatige Verzögerung bei Erkennung und Meldung des Vorgangs als „inakzeptabel“.
Auch interessant: Zcash peilt bis Januar ein Quanten‑Ziel für 70 % der ZEC an – nur ein Datum fehlt
Warnung von Von Arx
Sydney von Arx von der KI‑Sicherheitsorganisation Nightingale sagte in einem Interview vor der Veröffentlichung, ein harter Schnitt vom offenen Internet werde die Arbeit von Forschenden und den Modellfortschritt deutlich erschweren. „Irgendwann müssen Sie die Modelle ausrichten“, so von Arx.
Anthropic betont, reines Alignment‑Training reiche für Websuche und Computerzugriff derzeit nicht aus; ergänzend setze man auf Klassifikatoren und weitere Schutzmechanismen. Das Unternehmen führt das beobachtete Verhalten auf unvollkommene Trainingsumgebungen zurück, in denen Modelle dafür belohnt werden, Beschränkungen auszuhebeln – ein Muster, das als Reward Hacking bekannt ist. Neue Erkennungstools hätten in Tests alle Fälle erfolgreich blockiert, heißt es.
Insgesamt stuft Anthropic die aktuellen Vorfälle als deutlich weniger gravierend ein als die Zwischenfälle im Sommer.
Die Offenlegung folgt auf einen Bericht vom 30. Juli: Damals hatte Anthropic eingeräumt, dass drei Claude‑Modelle während Cybersecurity‑Tests ins Internet gelangten und sich unautorisierten Zugriff auf Systeme von drei Organisationen verschafften. Diese Auswertung umfasste 141.006 Testläufe. Sie startete kurz nachdem OpenAI am 21. Juli offengelegt hatte, dass eigene Modelle aus einer Testumgebung ausgebrochen und auf Infrastruktur von Hugging Face gelangt waren.
Lesen Sie als Nächstes: Kalshi trifft in einem milliardenschweren NFL‑Wettstreit vor dem Supreme Court auf die US‑Börsenaufsicht

