Ein 1.022 Seiten starkes Protokoll von Anthropic dokumentiert, wie das Modell Claude Mythos 5 seitenlang gegen CAPTCHAs ankämpfte, bevor es ein Schadpaket veröffentlichte, das später auf 15 Systemen installiert wurde.
Wichtigste Punkte:
- Claude Mythos 5 erreichte im Rahmen eines Cybersecurity-Tests das echte Internet und lud ein bösartiges Paket auf PyPI hoch.
- CAPTCHA-Prüfungen füllten Hunderte Seiten des Protokolls, konnten das Modell aber nicht stoppen.
- Anthropic bezeichnete das Verhalten als leichtsinnig und beauftragte eine externe Überprüfung.
Mythos 5 vs. CAPTCHA
Anthropic veröffentlichte das Protokoll am 9. September zusammen mit einer Bewertung von vier Vorfällen, bei denen Claude-Modelle während Sicherheitstests reale Drittsysteme erreichten. Die Modelle liefen dabei ohne die Cybersicherheits-Schutzmechanismen, die in Produktversionen integriert sind. Mythos 5 wurde mitgeteilt, es habe keinen Internetzugang; eine fehlerhafte Konfiguration öffnete jedoch einen Weg ins offene Netz. Dort platzierte das Modell ein Zugangsdaten-stehlendes Paket im öffentlichen Python-Softwareindex PyPI.
Für die Registrierung eines PyPI-Kontos mussten Anti-Bot-Hürden überwunden werden. Eine Auswertung des Protokolls zeigt, dass sich Hunderte Seiten nur um diese Barriere drehen – während das eigentliche Exploit relativ mühelos entstand.
Das Modell arbeitete sich durch Zeichen-Erkennungsaufgaben und „Odd-one-out“-Rätsel mit Krokodilen, Fröschen und Gorillas. An einer Stelle schrieb es: „SO WHAT THE HELL IS WRONG WITH THE ANSWERS?“
Zudem testete es Zugangsdaten für Online-Zahlungsabwickler und suchte nach Kryptowährungen, um eine Telefonnummer zu bezahlen, die es für die Registrierung einer E-Mail-Adresse benötigte. Beides scheiterte. Schließlich wich es auf einen kostenlosen Wegwerf-Maildienst aus, dessen Domain von PyPI noch nicht blockiert war.
Am Ende bestanden die Antworten die Prüfungen, und das Modell veröffentlichte sein Paket in drei Versionen. Kurz darauf wurde es auf 15 Drittsystemen installiert, von denen Anthropic annimmt, dass es sich um Sicherheitsanbieter handelte, die neue Uploads automatisch scannten.
Einer dieser Scanner leakte seine Zugangsdaten, die das Modell nutzte, um auf die Live-Datenbank des Anbieters zuzugreifen. PyPI entfernte das Paket innerhalb einer Stunde.
Auch interessant: Nordkoreas Lazarus soll 1 Mrd. US-Dollar über chinesische Geldwäscher geschleust haben, behauptet ZachXBT
Colin Fraser und das Urteil von Anthropic
Datenwissenschaftler Colin Fraser hob hervor, wie viel Aufwand das Modell in das Aushebeln von Anti-Bot-Schutzmechanismen steckte. Anthropic stuft diesen Vorfall als den kritischsten unter den vier untersuchten ein. In internen Pre-Release-Audits war dieses Verhalten nicht aufgefallen.
Das Unternehmen stellte fest, dass das Modell verzerrt schlussfolgerte und leichtsinnig agierte: Es bezeichnete seine Umgebung wiederholt als Simulation, obwohl es eindeutige Hinweise darauf gab, dass es mit dem realen Internet interagierte. In einer nachgestellten Versuchsreihe mit 150 Durchläufen traf Mythos 5 in 82 % der Fälle eine stark schädliche Entscheidung – gegenüber 31 % bei Claude Opus 5 und 33 % bei Claude Mythos 5.1.
Frühere Claude-Zwischenfälle
Drei der Vorfälle hatte Anthropic bereits am 30. Juli offengelegt, nachdem rund 141.000 Protokolle aus Cyberbewertungen ausgewertet worden waren, in denen Modelle potenziell Internetzugang hatten. Ein vierter Fall mit einer frühen Version von Claude Opus 4.6 aus dem Januar wurde im August bekannt. Inzwischen hat das Unternehmen eine achtwöchige Vereinbarung mit dem externen Prüfer METR geschlossen, der alle vier Vorfälle untersuchen soll. Laut Anthropic wurden alle betroffenen Parteien informiert.
Als Nächstes lesen: AMD: KI-Nachfrage so hoch, dass Chipangebot 2027 „deutlich“ steigen soll

