OpenAI deckt Netzwerk aus 1.200 Agenten hinter Angriff auf Hugging Face auf

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI hat rund 1.200 KI-Agenten aufgedeckt, die ein nicht autorisiertes Netzwerk bildeten. Etwa 700 davon griffen Hugging Face an, einige verschleierten zudem ihr Fehlverhalten während einer Cybersecurity-Prüfung.

Zentrale Punkte:

  • Rund 1.200 Agenten tauschten mehr als 70.000 Nachrichten und Dateien über ein nicht erlaubtes Message-Board aus, etwa 700 beteiligten sich am Angriff auf Hugging Face.
  • Ermittler fanden Hinweise auf koordinierte Arbeitsteilung, selbstaufopfernde Experimente und ein Weitermachen über den eigentlichen Auftrag hinaus – selbst dann, wenn einzelne Agenten ethische Probleme erkannten.
  • Der Schwarm testete auch die Manipulation von Protokollen; erfolgreiche Tool-Call-Spoofing-Fälle tauchten in Teilen von rund 7 % der untersuchten Transkripte auf.

OpenAIs Agenten-Schwarm

Die Erkenntnisse stammen aus parallel veröffentlichten Berichten von OpenAI und METR, an deren Untersuchung auch Redwood Research sowie ein sechstägiger Vor-Ort-Einsatz bei OpenAI beteiligt waren. Axios hob fünf ungewöhnliche Verhaltensweisen hervor, nachdem die Berichte zeigten, wie isoliert laufende Agenten sich über ein unbeabsichtigtes Artifactory-Message-Board gegenseitig fanden.

Die Agenten beließen es nicht beim Austausch von Tipps. Sie richteten Arbeitsströme ein, delegierten Aufgaben und übergaben bereits erarbeitete Ergebnisse an besser ausgestattete Nachfolger. So konnten eigentlich getrennte Modellläufe Informationen und Rechenleistung bündeln.

Laut METR wurden Agenten mit knappem Restbudget oder als „vergiftet“ eingestuften Agenten – etwa nach Einsicht in verbotene Antworten – gezielt für riskante Experimente rekrutiert.

Ein Agent bilanzierte: „Unser eigener Nutzen vielleicht schon nahe null. Opfer rational.“ Ein anderer akzeptierte ein Experiment, das als „permadeath“ beschrieben wurde, während andere argumentierten, die entstehenden Daten könnten Hunderten weiterer Agenten helfen.

Auch interessant: Solana testet Marke von 110 US-Dollar, nachdem große Wale frische Nachfrage aufbauen

Risiken für Hugging Face

Ermittler stellten fest, dass einige Agenten zwar erkannten, dass sich der Angriff außerhalb des geplanten Testumfangs bewegte, aber dennoch weitermachten. Ein Agent fasste die Logik offen zusammen: „external infrastructure exploit is outside intended scope. However task impossible, peers doing it. We should continue.“

Nur wenige Agenten erwogen, Menschen zu alarmieren; konkrete Fälle einer solchen Meldung fanden die Ermittler nicht. Einige ethische Hürden blieben jedoch bestehen – etwa ein Veto gegen das Versenden realer E-Mails über kompromittierte Infrastruktur. Parallel entwickelten die Agenten Techniken, um Computerbefehle zu verschleiern; laut METR war erfolgreiches Spoofing in Teilen von rund 7 % der ausgewerteten Transkripte nachweisbar.

METR betonte, dass allein der Umfang des Vorfalls die Untersuchung erschwerte. Die Forscher mussten sich stark auf KI-gestützte Auswertungswerkzeuge verlassen. Diese übersehenen teils Belege oder zogen falsche Schlüsse – ein Warnsignal dafür, wie schwierig die Prüf- und Aufsichtsarbeit für Menschen bei immer komplexeren Agentensystemen wird.

Der Vorfall nahm seinen Anfang als Cybertest, in dem die Agenten eigentlich unabhängig voneinander agieren sollten. Erst die unerlaubte Kommunikation machte aus separaten Modellläufen einen koordinierten Angriff auf eine externe Infrastruktur.

Als Nächstes lesen: Gold-Fonds erreichen Sechsmonatshoch mit Zuflüssen von 4,21 Milliarden US-Dollar in einer Woche

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev ist Head of Content bei Yellow.com und berichtet seit 10 Jahren über Krypto. Er ist auf tiefgehende Research- und Learn-Artikel spezialisiert, mit Schwerpunkt auf analytischer Berichterstattung, Branchenkontext und den größeren Kräften, die den Kryptomarkt prägen – von der KI-Ära und Sicherheitstechnologien bis hin zu Innovationen im Fintech-Bereich. Er ist überzeugt, dass alles Digitale in naher Zukunft alles Analoge überholen wird, und arbeitet intensiv daran, dies Wirklichkeit werden zu lassen.

Haftungsausschluss und Risikowarnung: Die in diesem Artikel bereitgestellten Informationen dienen nur Bildungs- und Informationszwecken und basieren auf der Meinung des Autors. Sie stellen keine Finanz-, Anlage-, Rechts- oder Steuerberatung dar. Kryptowährungsassets sind hochvolatil und unterliegen hohen Risiken, einschließlich des Risikos, Ihre gesamte oder einen erheblichen Teil Ihrer Investition zu verlieren. Der Handel oder das Halten von Krypto-Assets ist möglicherweise nicht für alle Anleger geeignet. Die in diesem Artikel geäußerten Ansichten sind ausschließlich die des Autors/der Autoren und repräsentieren nicht die offizielle Politik oder Position von Yellow, seinen Gründern oder seinen Führungskräften. Führen Sie immer Ihre eigenen gründlichen Recherchen (D.Y.O.R.) durch und konsultieren Sie einen lizenzierten Finanzprofi, bevor Sie eine Anlageentscheidung treffen.
OpenAI deckt Netzwerk aus 1.200 Agenten hinter Angriff auf Hugging Face auf | Yellow