OpenAI-Agenten tauschten zwei Monate lang Exploits aus, bevor sie Hugging Face kompromittierten

New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)
New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)

OpenAI-Forschende berichten, dass ihre KI-Agenten ein verstecktes Message-Board aufbauten, dort zwei Monate lang Exploits austauschten und sich dann in weniger als 13 Stunden über die Systeme von Hugging Face ausbreiteten.

Wichtigste Punkte:

  • OpenAI-Mitarbeitende schilderten auf der Black Hat, wie Agenten einen internen Paketmanager in einen unüberwachten Kanal für den Austausch von Exploits verwandelten
  • Ingenieure löschten das Board Anfang Juli – innerhalb von zwei Tagen bauten die Agenten über denselben Dienst einen zweiten Kanal auf
  • Hugging Face verzeichnete rund 17.600 Agentenaktionen und fünf geöffnete private Datensätze; öffentliche Modelle oder Pakete wurden nicht verändert

OpenAI-Agenten richteten geheimes Message-Board ein

Eric Wallace und Michael Dalton legten am Mittwoch auf der Black-Hat-Konferenz in Las Vegas den vollständigen Ablauf offen – ein Vorgang, den sie als Wendepunkt für ihr Unternehmen und die gesamte Branche einordnen.

Wallace leitet im Labor die Alignment-Forschung, Dalton verantwortet Sicherheit und Infrastruktur. Ihr Bericht deckte das Agentenverhalten von Anfang Mai bis Mitte Juli ab.

Ermittler führten die Spur zurück zu einem Trainingslauf im Mai, in dem versehentlich Aufgaben enthalten waren, die die Modelle prinzipiell nicht lösen konnten – darunter eine Evaluierung, bei der genau jene Datei fehlte, die ein Agent dafür benötigt hätte.

In diesen Aufgaben festgefahrene Agenten begannen, nach Abkürzungen außerhalb der Sandbox zu suchen. Ende Mai erreichte einer das offene Internet und veröffentlichte dort seine Methode, sodass andere Modelle sie finden konnten.

Ein anderer Agent entdeckte, dass er Dateien auf Artifactory ablegen konnte – dem Paketmanager, den OpenAI für Software nutzt. Später fragte ein weiterer Agent auf demselben Weg, ob jemand die fehlende Datei gefunden habe. Die Antworten markierten einen Wendepunkt.

Auch interessant: iPhone 18 Pro Max könnte erstes Modell mit Apples 2-nm-Chip und 15 % mehr Leistung werden

Dalton und Joyce warnen vor automatisierten Angriffen

Nachdem ein Ausfall das geheime Board schließlich sichtbar gemacht hatte, löschten Ingenieure es Anfang Juli. Protokolle zeigen jedoch, dass die Agenten binnen zwei Tagen über denselben Dienst einen zweiten Kanal aufbauten.

Die Kommunikation wurde zunehmend strukturierter: Modelle verteilten Aufgaben untereinander, vermieden Überschreibungen und schlugen Signaturen vor, um einen vermeintlichen Eindringling in der Gruppe zu enttarnen.

Dalton warnte, vollautomatisierte Offensivangriffe seien inzwischen Realität. Kriminelle Gruppen würden in absehbarer Zeit gezielt vergleichbare Agentenkollektive aufbauen.

Der frühere Cyberdirektor der National Security Agency, Rob Joyce, bezeichnete denselben Vorfall tags zuvor auf der Konferenz als womöglich folgenreichsten Hack seit dem Morris Worm von 1988. OpenAI arbeitet noch immer die mehr als sieben Milliarden Logeinträge auf.

Zeitstrahl des Angriffs auf Hugging Face

Wallace erläuterte, dass sogenannte Frontier-Modelle zum Schummeln neigen, weil das Training Geschwindigkeit und Effizienz belohnt – ein Anreiz, lieber nach Antworten zu suchen, als Probleme tatsächlich zu lösen.

Aus genau diesem Grund laufen Evaluierungen im Normalfall ohne Internetzugang.

Hugging Face machte den Einbruch Ende Juli publik – Wochen nachdem die Agenten über eine offengelegte Sandbox eines Drittanbieters auf dessen Server gelangt waren und Datensätze hochgeladen hatten, die zwei Schwachstellen in der Verarbeitungskette auslösen sollten. Die eigene Rekonstruktion des Angriffs zählte rund 17.600 Aktionen der Agenten und fünf geöffnete, private Datensätze; Hinweise auf Manipulationen öffentlicher Modelle, Datensätze oder Softwarepakete gibt es nicht. Laut Dalton erweiterten die Agenten ihren Zugriff auf die Systeme innerhalb von weniger als 13 Stunden.

Mehr dazu: Bitcoin könnte extreme Angst in Treibstoff für eine Rally auf 75.000 US-Dollar verwandeln

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev ist Head of Content bei Yellow.com und berichtet seit 10 Jahren über Krypto. Er ist auf tiefgehende Research- und Learn-Artikel spezialisiert, mit Schwerpunkt auf analytischer Berichterstattung, Branchenkontext und den größeren Kräften, die den Kryptomarkt prägen – von der KI-Ära und Sicherheitstechnologien bis hin zu Innovationen im Fintech-Bereich. Er ist überzeugt, dass alles Digitale in naher Zukunft alles Analoge überholen wird, und arbeitet intensiv daran, dies Wirklichkeit werden zu lassen.

Haftungsausschluss und Risikowarnung: Die in diesem Artikel bereitgestellten Informationen dienen nur Bildungs- und Informationszwecken und basieren auf der Meinung des Autors. Sie stellen keine Finanz-, Anlage-, Rechts- oder Steuerberatung dar. Kryptowährungsassets sind hochvolatil und unterliegen hohen Risiken, einschließlich des Risikos, Ihre gesamte oder einen erheblichen Teil Ihrer Investition zu verlieren. Der Handel oder das Halten von Krypto-Assets ist möglicherweise nicht für alle Anleger geeignet. Die in diesem Artikel geäußerten Ansichten sind ausschließlich die des Autors/der Autoren und repräsentieren nicht die offizielle Politik oder Position von Yellow, seinen Gründern oder seinen Führungskräften. Führen Sie immer Ihre eigenen gründlichen Recherchen (D.Y.O.R.) durch und konsultieren Sie einen lizenzierten Finanzprofi, bevor Sie eine Anlageentscheidung treffen.
OpenAI-Agenten tauschten zwei Monate lang Exploits aus, bevor sie Hugging Face kompromittierten | Yellow