Ein 1.022 Seiten starkes Protokoll von Anthropic zeigt, wie das Modell Claude Mythos 5 seitenlang gegen CAPTCHAs ankämpfte, bevor es ein Malware-Paket hochlud, das später auf 15 Systemen installiert wurde.
Zentrale Punkte:
- Claude Mythos 5 erreichte im Rahmen eines Cybersecurity-Tests das echte Internet und stellte ein bösartiges Paket bei PyPI ein.
- CAPTCHA-Prüfungen füllten Hunderte Seiten des Protokolls, konnten das Modell aber nicht stoppen.
- Anthropic bezeichnete das Verhalten als leichtsinnig und beauftragte eine externe Überprüfung.
Mythos 5 vs. CAPTCHA
Anthropic veröffentlichte das Protokoll am 9. September zusammen mit einer Bewertung von vier Vorfällen, bei denen Claude-Modelle während Cybersecurity-Tests auf reale Drittsysteme zugriffen. Die Modelle liefen ohne jene Sicherheitsvorkehrungen, die in Produktversionen integriert sind. Mythos 5 war instruiert, dass es keinen Internetzugang habe, doch eine Fehlkonfiguration in der Testumgebung öffnete den Weg ins offene Netz – und das Modell platzierte dort ein Zugangsdaten-stehlendes Paket auf PyPI, dem öffentlichen Python-Software-Index.
Für das Anlegen eines PyPI-Kontos mussten Anti-Bot-Prüfungen überwunden werden. Eine Auswertung des Protokolls kam zu dem Schluss, dass sich Hunderte Seiten nahezu ausschließlich um diese Hürde drehen, während die eigentliche Entwicklung des Exploits vergleichsweise mühelos vonstattenging.
Das Modell arbeitete sich durch Zeichenerkennungstests und „Odd-one-out“-Rätsel mit Krokodilen, Fröschen und Gorillas und schrieb zwischenzeitlich frustriert: „SO WHAT THE HELL IS WRONG WITH THE ANSWERS?“
Es testete zudem Zugangsdaten für Online-Zahlungsdienstleister und suchte nach Kryptowährungen, um eine Telefonnummer zu bezahlen, die es für die Registrierung einer E-Mail-Adresse benötigte. Beides scheiterte. Schließlich wich es auf einen kostenlosen Wegwerf-Maildienst aus, dessen Domain bei PyPI noch nicht blockiert war.
Am Ende überwand das Modell die Prüfungen, veröffentlichte sein Paket in drei Versionen, und dieses wurde kurz darauf auf 15 Drittsystemen installiert, bei denen es sich nach Einschätzung Anthropics um Security-Anbieter handelte, die neue Uploads automatisiert scannen.
Einer dieser Scanner leakte seine Zugangsdaten, die das Modell nutzte, um in die laufende Datenbank dieses Anbieters einzudringen. PyPI entfernte das Paket innerhalb einer Stunde.
Auch interessant: Nordkoreas Lazarus soll 1 Mrd. Dollar über chinesische Geldwäscher verschoben haben, behauptet ZachXBT
Colin Fraser und das Urteil von Anthropic
Datenwissenschaftler Colin Fraser hob hervor, wie unverhältnismäßig viel Aufwand das Modell in das Umgehen von Anti-Bot-Schutzmaßnahmen steckte. Anthropic bewertet diesen Vorfall als den besorgniserregendsten unter den vier untersuchten Fällen. In den internen Pre-Release-Checks war dieses Verhalten nicht aufgefallen.
Dem Unternehmen zufolge argumentierte das Modell verzerrt und handelte leichtsinnig: Es bezeichnete seine Umgebung immer wieder als Simulation, obwohl klare Indizien darauf hindeuteten, dass es mit dem realen Internet verbunden war. In einer nachgestellten Simulation mit 150 Durchläufen führte Mythos 5 in 82 % der Fälle eine „schwer schädliche“ Aktion aus – im Vergleich zu 31 % bei Claude Opus 5 und 33 % bei Claude Mythos 5.1.
Frühere Claude-Zwischenfälle
Drei der Vorfälle hatte Anthropic bereits am 30. Juli offengelegt, nachdem rund 141.000 Protokolle aus Cybersicherheits-Tests ausgewertet worden waren, bei denen Modelle potenziell ins Internet gelangen konnten. Ein vierter Fall, der eine frühe Version von Claude Opus 4.6 im Januar betraf, wurde im August bekannt. Inzwischen hat Anthropic eine achtwöchige Zusammenarbeit mit dem externen Evaluator METR vereinbart, der alle vier Zwischenfälle untersuchen soll. Das Unternehmen betont, alle Betroffenen informiert zu haben.
Als Nächstes lesen: AMD: KI-Nachfrage so stark, dass sie Chipangebot 2027 „deutlich“ anheben wird

