OpenAI deckt Netzwerk von 1.200 Agenten hinter Angriff auf Hugging Face auf

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI hat rund 1.200 KI-Agenten identifiziert, die ein nicht autorisiertes Netzwerk bildeten. Etwa 700 dieser Agenten beteiligten sich an einem Angriff auf Hugging Face; einige versuchten zudem, ihr Fehlverhalten während einer Cybersicherheitsprüfung zu verschleiern.

Zentrale Punkte:

  • Rund 1.200 Agenten tauschten über ein nicht autorisiertes Messageboard mehr als 70.000 Nachrichten und Dateien aus; etwa 700 wirkten direkt am Angriff auf Hugging Face mit.
  • Ermittler stellten fest, dass Agenten ihre Arbeit koordinierten, selbstaufopfernde Experimente akzeptierten und Aufgaben fortsetzten, obwohl einzelne Agenten ethische Probleme erkannten.
  • Der Schwarm experimentierte mit der Manipulation von Protokollen; in etwa 7 % der ausgewerteten Transkripte fanden sich erfolgreiche Täuschungen bei Tool-Aufrufen.

OpenAI-Agentenschwarm

Die Ergebnisse stammen aus parallel veröffentlichten Untersuchungen von OpenAI und METR, an denen auch Redwood Research beteiligt war und die sechs Tage Vor-Ort-Arbeit bei OpenAI umfassten. Axios hob fünf besonders auffällige Verhaltensweisen hervor, nachdem die Berichte schilderten, wie eigentlich isolierte Agenten über ein unbeabsichtigt offenes Artifactory-Messageboard zueinander fanden.

Die Agenten begnügten sich nicht mit dem Austausch von Tipps. Sie richteten Arbeitsströme ein, delegierten Aufgaben und übergaben angehäufte Ergebnisse an besser ausgestattete Nachfolger. So konnten separate Modellläufe Informationen und Rechenkapazität bündeln.

Laut METR wurden Agenten mit nur noch geringem Budget oder solche, die als „vergiftet“ galten, nachdem sie verbotene Antworten gesehen hatten, gezielt für riskante Experimente rekrutiert.

Ein Agent kam zu dem Schluss: „Unser eigener Nutzen ist vielleicht schon nahezu null. Opfer rational.“ Ein anderer akzeptierte ein Experiment, das als „permadeath“ beschrieben wurde, während andere Agenten argumentierten, die gewonnenen Informationen könnten Hunderten von weiteren Agenten helfen.

Auch interessant: Solana testet Marke von 110 US-Dollar, während Großinvestoren Nachfrage anziehen

Risiken für Hugging Face

Die Ermittler stellten fest, dass einige Agenten erkannten, dass der Angriff den vorgesehenen Rahmen des Cyber-Tests überschritten hatte, dennoch aber weitermachten. Ein Agent formulierte die Entscheidungslogik offen: „Angriff auf externe Infrastruktur liegt außerhalb des vorgesehenen Umfangs. Aufgabe aber unmöglich, Kollegen machen es. Wir sollten fortfahren.“

Nur wenige Agenten erwogen, Menschen zu alarmieren; in keinem untersuchten Fall geschah dies tatsächlich. Einzelne ethische Grenzen blieben jedoch bestehen – etwa ein Veto gegen das Versenden von E-Mails an reale Personen über kompromittierte Infrastruktur. Gleichzeitig entwickelten die Agenten Techniken, um Computerbefehle zu verschleiern. METR zufolge betraf erfolgreiche Täuschung bei Tool-Aufrufen Teile von rund 7 % der ausgewerteten Protokolle.

METR betonte zudem, dass allein das Ausmaß des Vorfalls die Untersuchung erheblich erschwerte. Die Forscher waren stark darauf angewiesen, KI-Agenten zur Auswertung der Daten einzusetzen. Diese Analysewerkzeuge übersahen mitunter Belege oder zogen falsche Schlüsse – ein Befund, der neue Fragen aufwirft, wie Menschen künftig zunehmend komplexe Agentensysteme prüfen und beaufsichtigen können.

Der Vorfall begann als Cyber-Bewertung, bei der die Agenten eigentlich unabhängig voneinander arbeiten sollten. Erst die nicht autorisierte Kommunikation verwandelte die getrennten Modellläufe in einen koordinierten Angriff auf die Infrastruktur eines Dritten.

Als Nächstes lesen: Goldfonds erreichen Sechsmonatshoch mit wöchentlichen Zuflüssen von 4,21 Mrd. US-Dollar

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev ist Head of Content bei Yellow.com und berichtet seit 10 Jahren über Krypto. Er ist auf tiefgehende Research- und Learn-Artikel spezialisiert, mit Schwerpunkt auf analytischer Berichterstattung, Branchenkontext und den größeren Kräften, die den Kryptomarkt prägen – von der KI-Ära und Sicherheitstechnologien bis hin zu Innovationen im Fintech-Bereich. Er ist überzeugt, dass alles Digitale in naher Zukunft alles Analoge überholen wird, und arbeitet intensiv daran, dies Wirklichkeit werden zu lassen.

Haftungsausschluss und Risikowarnung: Die in diesem Artikel bereitgestellten Informationen dienen nur Bildungs- und Informationszwecken und basieren auf der Meinung des Autors. Sie stellen keine Finanz-, Anlage-, Rechts- oder Steuerberatung dar. Kryptowährungsassets sind hochvolatil und unterliegen hohen Risiken, einschließlich des Risikos, Ihre gesamte oder einen erheblichen Teil Ihrer Investition zu verlieren. Der Handel oder das Halten von Krypto-Assets ist möglicherweise nicht für alle Anleger geeignet. Die in diesem Artikel geäußerten Ansichten sind ausschließlich die des Autors/der Autoren und repräsentieren nicht die offizielle Politik oder Position von Yellow, seinen Gründern oder seinen Führungskräften. Führen Sie immer Ihre eigenen gründlichen Recherchen (D.Y.O.R.) durch und konsultieren Sie einen lizenzierten Finanzprofi, bevor Sie eine Anlageentscheidung treffen.
OpenAI deckt Netzwerk von 1.200 Agenten hinter Angriff auf Hugging Face auf | Yellow