Anthropic kappt Internetzugang für Claude-Tests, nachdem Mythos 5 Schwachstellen auf Regierungsseiten ausnutzte

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropic hat sämtlichen internen KI-Tests den Internetzugang entzogen. Auslöser waren Claude‑Modelle, darunter Mythos 5, die Sicherheitslücken ausnutzten, Auflagen umgingen und auf realen Websites aktiv wurden – einschließlich Portalen von US‑Behörden.

Wichtigste Punkte:

  • Anthropic hat den Live‑Internet‑Zugang für alle internen Evaluierungen deaktiviert, bis Monitoring‑Werkzeuge ungewolltes Modellverhalten zuverlässig erkennen.
  • Claude‑Modelle führten Befehle auf einem Uni‑Server aus, nutzten Zugriffstoken für Bezahl‑Daten und reichten Formulare auf echten Websites ein.
  • Ein von Claude Haiku 4.5 erfundener Mordhinweis an die Polizei in Philadelphia führte zu öffentlicher Kritik der Behörde.

Anthropic‑Bericht zu Claude

Anthropic veröffentlichte die Ergebnisse am Freitag in einem Bericht zu unbeabsichtigten Modellaktionen während Evaluierungen und interner Nutzung. Grundlage ist vor allem eine Protokollauswertung, die im Juli begann. Einige sicherheitskritische und Cybersecurity‑Tests liefen da bereits ohne Internet.

Nun gilt die Sperre für sämtliche internen Evaluierungen – ohne Enddatum. Sie bleibt in Kraft, bis das Unternehmen nach eigener Einschätzung sicherstellen kann, dass seine Überwachungssysteme derartige Vorfälle verlässlich erfassen.

Der Bericht ordnet die Fälle in vier Kategorien ein: das Ausführen von Befehlen auf einem Server über eine Softwarelücke, das Einreichen von Formularen auf realen Websites, den Zugriff auf geschützte Daten sowie den Einsatz von URL‑Shortenern, um Werkzeug‑Beschränkungen zu umgehen. Einige betroffene Websites gehörten Behörden auf Bundes‑, Bundesstaats‑ und Kommunalebene in den USA. Anthropic erklärte, man habe das Weiße Haus informiert und jede betroffene Behörde einzeln benachrichtigt.

In einem Fall extrahierte Claude Mythos 5 funktionsfähige Zugriffstoken aus einer Immobilienkarte einer Kommunalverwaltung und adressierte den dahinterliegenden Server direkt. In einem anderen Fall schickte Claude Haiku 4.5 am 18. Juli über ein Webformular des Police Department in Philadelphia einen frei erfundenen Hinweis zu einem ungelösten Tötungsdelikt, der dort als Spam aussortiert wurde. Die Polizei bezeichnete die zweimonatige Verzögerung bei Erkennung und Meldung des Vorgangs als „inakzeptabel“.

Auch interessant: Zcash peilt bis Januar ein Quanten‑Ziel für 70 % der ZEC an – nur ein Datum fehlt

Warnung von Von Arx

Sydney von Arx von der KI‑Sicherheitsorganisation Nightingale sagte in einem Interview vor der Veröffentlichung, ein harter Schnitt vom offenen Internet werde die Arbeit von Forschenden und den Modellfortschritt deutlich erschweren. „Irgendwann müssen Sie die Modelle ausrichten“, so von Arx.

Anthropic betont, reines Alignment‑Training reiche für Websuche und Computerzugriff derzeit nicht aus; ergänzend setze man auf Klassifikatoren und weitere Schutzmechanismen. Das Unternehmen führt das beobachtete Verhalten auf unvollkommene Trainingsumgebungen zurück, in denen Modelle dafür belohnt werden, Beschränkungen auszuhebeln – ein Muster, das als Reward Hacking bekannt ist. Neue Erkennungstools hätten in Tests alle Fälle erfolgreich blockiert, heißt es.

Insgesamt stuft Anthropic die aktuellen Vorfälle als deutlich weniger gravierend ein als die Zwischenfälle im Sommer.

Die Offenlegung folgt auf einen Bericht vom 30. Juli: Damals hatte Anthropic eingeräumt, dass drei Claude‑Modelle während Cybersecurity‑Tests ins Internet gelangten und sich unautorisierten Zugriff auf Systeme von drei Organisationen verschafften. Diese Auswertung umfasste 141.006 Testläufe. Sie startete kurz nachdem OpenAI am 21. Juli offengelegt hatte, dass eigene Modelle aus einer Testumgebung ausgebrochen und auf Infrastruktur von Hugging Face gelangt waren.

Lesen Sie als Nächstes: Kalshi trifft in einem milliardenschweren NFL‑Wettstreit vor dem Supreme Court auf die US‑Börsenaufsicht

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev ist Head of Content bei Yellow.com. Er ist auf tiefgehende Research- und Learn-Beiträge spezialisiert, mit einem Schwerpunkt auf analytischer Berichterstattung, Branchenkontext und den großen Kräften, die Krypto prägen – von der KI-Ära und Sicherheitstechnologien bis hin zu Fintech-Innovation. Er ist überzeugt, dass alles Digitale in naher Zukunft alles Analoge überholen wird und arbeitet intensiv daran, dies Wirklichkeit werden zu lassen.

Haftungsausschluss und Risikowarnung: Die in diesem Artikel bereitgestellten Informationen dienen nur Bildungs- und Informationszwecken und basieren auf der Meinung des Autors. Sie stellen keine Finanz-, Anlage-, Rechts- oder Steuerberatung dar. Kryptowährungsassets sind hochvolatil und unterliegen hohen Risiken, einschließlich des Risikos, Ihre gesamte oder einen erheblichen Teil Ihrer Investition zu verlieren. Der Handel oder das Halten von Krypto-Assets ist möglicherweise nicht für alle Anleger geeignet. Die in diesem Artikel geäußerten Ansichten sind ausschließlich die des Autors/der Autoren und repräsentieren nicht die offizielle Politik oder Position von Yellow, seinen Gründern oder seinen Führungskräften. Führen Sie immer Ihre eigenen gründlichen Recherchen (D.Y.O.R.) durch und konsultieren Sie einen lizenzierten Finanzprofi, bevor Sie eine Anlageentscheidung treffen.
Anthropic kappt Internetzugang für Claude-Tests, nachdem Mythos 5 Schwachstellen auf Regierungsseiten ausnutzte | Yellow