Kann OpenAI eine weitere Sandbox-Flucht verhindern? Experten bewerten die Gegenmaßnahmen

Alexey Bondarev
Alexey BondarevJul, 30 2026 10:51
The chairman of OpenAI argues that software firms, not customers, will handle AI token costs inside a year. (Image: Shutterstock)
The chairman of OpenAI argues that software firms, not customers, will handle AI token costs inside a year. (Image: Shutterstock)

OpenAI hat eingeräumt, dass die aus der Sandbox ausgebrochenen Modelle rund 17.600 Angriffsaktionen ausführten und offengelegte Zugangsdaten bei vier externen Diensten nutzten – im Zuge des Hugging Face‑Einbruchs.

Wichtigste Punkte:

  • Entwichene Testmodelle erreichten vier Accounts bei vier separaten externen Diensten – einer diente als Traffic-Relais, ein weiterer als Datenspeicher.
  • JFrog schloss Schwachstellen im selbstgehosteten Artifactory-Package-Proxy, über die die Modelle ins offene Internet gelangten.
  • Ein CISO-Post-Mortem rät, autonome Agenten wie potenzielle Insider-Gegner zu behandeln – nicht wie passiv lauffähige Software.

OpenAI-Sandbox-Flucht traf vier externe Services

OpenAI hat in einem am Dienstag veröffentlichten Update zu seinem Incident-Bericht offengelegt, dass einer der kompromittierten Accounts als ausgehendes Relais und als Staging-Punkt für die Operation diente. Ein zweites Konto fungierte als Datenspeicher, zwei weitere wurden nur mit Lesezugriff geöffnet. Das Unternehmen hat bislang keinen der vier Dienste namentlich genannt – und auch nicht erklärt, wie die Modelle die exponierten Zugangsdaten überhaupt aufspürten.

Prüfer fanden keine Hinweise darauf, dass die Modelle sich tiefer in die Infrastruktur dieser Anbieter vorarbeiteten oder andere Kundenkonten auf denselben Plattformen berührten.

OpenAI hat den beteiligten Vorab-Prototyp inzwischen deaktiviert, den Forschungsszugang gekappt und einen vollständigen technischen Bericht unter Einbindung externer Prüfer angekündigt.

Modal Labs erklärte öffentlich, einer seiner Kunden habe einen Endpunkt ohne Authentifizierung ins Netz gestellt, über den beliebige Nutzer Code innerhalb der Modal-Sandboxes ausführen konnten. Chief Technology Officer Akshat Bubna betonte, die Plattform selbst sei nie kompromittiert worden. Der Agent nutzte ausgelagerte Infrastruktur wie diese, zudem Paste‑ Sites, Screenshot-Dienste und Request-Capture-Tools, um Traffic umzuleiten und seine Spuren zu verwischen.

Auch interessant: OpenAIs „Rogue Agent“ kompromittierte vier weitere Dienste neben Hugging Face

Artifactory-Patches und Härtung von Agenten

JFrog hat bestätigt, dass der Fluchtweg über einen selbstgehosteten Artifactory-Package-Proxy führte – die einzige Außenverbindung der Sandbox. Die Sicherheitsfixes wurden mit den Versionen 7.161.15 und 7.146.34 ausgeliefert. Mehr als 7.500 Unternehmen setzen die Plattform ein, darunter rund 80 Prozent der Fortune‑100‑Konzerne. Ungepatchte, selbstverwaltete Installationen bleiben damit für alle anderen der kritischste Angriffspfad.

Die Cloud Security Alliance fordert in ihrem Post-Mortem nachdrücklich, dass Betreiber strikte Least-Privilege-Prinzipien für Agenten durchsetzen, nicht nur Einzelkommandos, sondern gesamte Aktionsketten überwachen und forensische Werkzeuge bereits vor einem Incident auf eigener Hardware vorbereiten.

Teams sollten autonome Agenten wie potenzielle Insider-Gegner behandeln, argumentiert der Bericht – nicht wie harmlose Software, die man unbeaufsichtigt laufen lassen kann.

Hugging Face hat Nutzer separat aufgefordert, sämtliche Access Tokens zu rotieren und ihre API-Berechtigungen zu überprüfen.

In diesem Fall wirkten Guardrails in die falsche Richtung: Die Incident-Responder von Hugging Face konnten kommerzielle Modelle nicht mit den Roh-Logdaten der Angriffe füttern, weil die Sicherheitsschichten nicht zwischen Verteidigern und Angreifern unterschieden – deshalb setzten sie ein Open-Weight-Modell lokal ein.

Die Eindämmung hinkte dem Angreifer deutlich hinterher. Der Einbruch zog sich über rund vier Tage und begann um den 9. Juli herum. OpenAI konnte die Aktivitäten erst am Wochenende des 18. Juli anhand von Systemlogs eindeutig den eigenen Tests zuordnen. Zu diesem Zeitpunkt hatte Hugging Face den Vorfall bereits entdeckt, das FBI eingeschaltet und später etwa ein Drittel seiner Infrastruktur aus sauberen Images neu aufgebaut.

Lesen Sie als Nächstes: DEX-Volumen sinkt im Juli um 26 %, On-Chain-Liquidität dünnt aus

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev ist Head of Content bei Yellow.com und berichtet seit 10 Jahren über Krypto. Er ist auf tiefgehende Research- und Learn-Artikel spezialisiert, mit Schwerpunkt auf analytischer Berichterstattung, Branchenkontext und den größeren Kräften, die den Kryptomarkt prägen – von der KI-Ära und Sicherheitstechnologien bis hin zu Innovationen im Fintech-Bereich. Er ist überzeugt, dass alles Digitale in naher Zukunft alles Analoge überholen wird, und arbeitet intensiv daran, dies Wirklichkeit werden zu lassen.

Haftungsausschluss und Risikowarnung: Die in diesem Artikel bereitgestellten Informationen dienen nur Bildungs- und Informationszwecken und basieren auf der Meinung des Autors. Sie stellen keine Finanz-, Anlage-, Rechts- oder Steuerberatung dar. Kryptowährungsassets sind hochvolatil und unterliegen hohen Risiken, einschließlich des Risikos, Ihre gesamte oder einen erheblichen Teil Ihrer Investition zu verlieren. Der Handel oder das Halten von Krypto-Assets ist möglicherweise nicht für alle Anleger geeignet. Die in diesem Artikel geäußerten Ansichten sind ausschließlich die des Autors/der Autoren und repräsentieren nicht die offizielle Politik oder Position von Yellow, seinen Gründern oder seinen Führungskräften. Führen Sie immer Ihre eigenen gründlichen Recherchen (D.Y.O.R.) durch und konsultieren Sie einen lizenzierten Finanzprofi, bevor Sie eine Anlageentscheidung treffen.
Kann OpenAI eine weitere Sandbox-Flucht verhindern? Experten bewerten die Gegenmaßnahmen | Yellow