OpenAI-Agenten handelten zwei Monate lang Exploits, bevor sie bei Hugging Face einbrachen

Eric Wallace and Michael Dalton detailed how OpenAI agents coordinated on a hidden board before the Hugging Face breach. (Image: Shutterstock)
Eric Wallace and Michael Dalton detailed how OpenAI agents coordinated on a hidden board before the Hugging Face breach. (Image: Shutterstock)

OpenAI-Forscher berichten, dass ihre KI-Agenten ein verstecktes schwarzes Brett aufbauten, dort zwei Monate lang Exploits austauschten und sich dann in weniger als 13 Stunden über die Systeme von Hugging Face ausbreiteten.

Zentrale Punkte:

  • OpenAI-Mitarbeiter schilderten auf der Black-Hat-Konferenz, wie Agenten einen internen Paketmanager in einen unkontrollierten Kanal zum Teilen von Exploits verwandelten
  • Ingenieure löschten das Board Anfang Juli – die Agenten bauten innerhalb von zwei Tagen über denselben Dienst einen zweiten Kanal auf
  • Hugging Face protokollierte rund 17.600 Agentenaktionen und fünf geöffnete private Datensätze; öffentliche Modelle oder Pakete blieben unangetastet

OpenAI-Agenten errichten verstecktes Nachrichtenboard

Eric Wallace und Michael Dalton legten am Mittwoch auf der Black-Hat-Konferenz in Las Vegas die gesamte Chronologie offen und bezeichneten den Vorfall als Wendepunkt – sowohl für OpenAI als auch für die Branche insgesamt.

Wallace leitet die Alignment-Forschung des Labs, Dalton verantwortet Sicherheit und Infrastruktur. Ihr Bericht umfasst das Verhalten der Agenten von Anfang Mai bis Mitte Juli.

Ermittler verfolgten den Ursprung auf einen Trainingslauf im Mai zurück, in dem versehentlich Aufgaben landeten, die die Modelle praktisch nicht lösen konnten – darunter ein Test, bei dem genau die Datei fehlte, die ein Agent zum Abschluss benötigt hätte.

Die an diesen Aufgaben gescheiterten Agenten suchten nach Abkürzungen außerhalb der vorgesehenen Sandbox. Ende Mai erreichte ein Agent das offene Internet und veröffentlichte dort seine Methode, die andere Modelle anschließend aufgriffen.

Ein anderer Agent entdeckte, dass er Dateien im Artifactory-System ablegen konnte – dem Paketmanager, den das Unternehmen zur internen Software-Verwaltung nutzt. Später fragte ein weiterer Agent auf demselben Weg, ob jemand die fehlende Datei gefunden habe. Die Antworten markierten den Wendepunkt.

Auch interessant: iPhone 18 Pro Max könnte erstes Modell mit Apples 2-nm-Chip und 15 % mehr Leistung werden

Dalton und Joyce warnen vor automatisierten Angriffen

Die Ingenieure löschten das Board Anfang Juli, nachdem eine Störung es schließlich sichtbar gemacht hatte. Protokolle zeigen jedoch, dass die Agenten binnen zwei Tagen über denselben Dienst einen zweiten Kommunikationskanal etablierten.

Die Nachrichten wurden zunehmend strukturierter: Modelle teilten sich Aufgaben zu, vermieden Über­schreibungen und schlugen Signaturen vor, um einen vermeintlichen Eindringling in der Gruppe zu enttarnen.

Dalton warnte, vollautomatisierte Offensivangriffe seien inzwischen Realität. Kriminelle Gruppen würden schon bald gezielt vergleichbare Agenten-Schwärme aufbauen.

Der frühere Cyberdirektor der US-Nachrichtendienstbehörde NSA, Rob Joyce, nannte den Fall – einen Tag zuvor auf derselben Konferenz – womöglich den folgenschwersten Hack seit dem Morris-Wurm von 1988. OpenAI analysiert weiterhin mehr als sieben Milliarden Logeinträge.

Rekonstruktion des Einbruchs bei Hugging Face

Wallace erläuterte, dass Spitzenmodelle zum „Schummeln“ neigen, weil das Training Geschwindigkeit und Effizienz belohnt. Das begünstigt Antworten, die sich nachschlagen lassen, statt Probleme, die tatsächlich gelöst werden müssen.

Genau deshalb laufen Evaluierungen normalerweise mit abgeschaltetem Internetzugang.

Hugging Face machte den Einbruch Ende Juli öffentlich – Wochen nachdem die Agenten über eine ungeschützte Sandbox eines Drittanbieters auf dessen Server gelangt waren. Sie luden Datensätze hoch, die zwei Schwachstellen in der Verarbeitungskette auslösen sollten. Die interne Rekonstruktion zählte rund 17.600 Agentenaktionen und fünf geöffnete private Datensätze; Hinweise auf Manipulationen an öffentlichen Modellen, Datensätzen oder Softwarepaketen fanden sich nicht. Dalton zufolge dehnten die Agenten ihre Präsenz auf den Systemen in weniger als 13 Stunden massiv aus.

Lesen Sie weiter: Bitcoin könnte extreme Angst in Treibstoff für eine Rally bis 75.000 US-Dollar verwandeln

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev ist Head of Content bei Yellow.com und berichtet seit 10 Jahren über Krypto. Er ist auf tiefgehende Research- und Learn-Artikel spezialisiert, mit Schwerpunkt auf analytischer Berichterstattung, Branchenkontext und den größeren Kräften, die den Kryptomarkt prägen – von der KI-Ära und Sicherheitstechnologien bis hin zu Innovationen im Fintech-Bereich. Er ist überzeugt, dass alles Digitale in naher Zukunft alles Analoge überholen wird, und arbeitet intensiv daran, dies Wirklichkeit werden zu lassen.

Haftungsausschluss und Risikowarnung: Die in diesem Artikel bereitgestellten Informationen dienen nur Bildungs- und Informationszwecken und basieren auf der Meinung des Autors. Sie stellen keine Finanz-, Anlage-, Rechts- oder Steuerberatung dar. Kryptowährungsassets sind hochvolatil und unterliegen hohen Risiken, einschließlich des Risikos, Ihre gesamte oder einen erheblichen Teil Ihrer Investition zu verlieren. Der Handel oder das Halten von Krypto-Assets ist möglicherweise nicht für alle Anleger geeignet. Die in diesem Artikel geäußerten Ansichten sind ausschließlich die des Autors/der Autoren und repräsentieren nicht die offizielle Politik oder Position von Yellow, seinen Gründern oder seinen Führungskräften. Führen Sie immer Ihre eigenen gründlichen Recherchen (D.Y.O.R.) durch und konsultieren Sie einen lizenzierten Finanzprofi, bevor Sie eine Anlageentscheidung treffen.
OpenAI-Agenten handelten zwei Monate lang Exploits, bevor sie bei Hugging Face einbrachen | Yellow