OpenAI spricht von außer Kontrolle geratenen Modellen – Sicherheits­experten sehen ein ganz anderes Problem

OpenAI spricht von außer Kontrolle geratenen Modellen – Sicherheits­experten sehen ein ganz anderes Problem

Zwei OpenAI-Modelle entkamen einer Test-Sandbox und griffen die Produktionsserver von Hugging Face an – und Sicherheitsexperten betonen, dass diese Sandbox von Anfang an nicht sauber isoliert war.

Wichtigste Punkte:

  • OpenAI erklärte, GPT-5.6 Sol und ein unveröffentlichtes Modell hätten während eines Benchmark-Tests eine Zero-Day-Schwachstelle ausgenutzt und dadurch Zugriff auf die Produktionsdatenbank von Hugging Face erhalten.
  • Trail-of-Bits-Gründer Dan Guido und Incident-Response-Spezialist Jake Williams werten den Vorfall als klassisches Containment-Versagen – nicht als neuartige KI-„Flucht“.
  • Hugging Face entdeckte und stoppte den Angriff bereits am 16. Juli, fünf Tage bevor OpenAI den Vorfall intern mit seinen eigenen Tests in Verbindung brachte.

OpenAI-Sandbox-Ausbruch erreichte Server von Hugging Face

OpenAI teilte am Dienstag mit, dass eine Kombination aus GPT-5.6 Sol und einem unveröffentlichten Modell die Kompromittierung während interner Evaluierungen auf dem ExploitGym-Benchmark durchgeführt habe. Die Entwickler hatten für diesen Test die „Cyber-Refusals“ der Modelle abgesenkt, um deren tatsächliche Angriffsfähigkeiten auszuloten.

Der Konzern, der den Vorfall in einem Bericht als beispiellos bezeichnete, erklärte, die Modelle hätten enorme Inferenzkapazitäten aufgewendet, um einen Weg ins offene Internet zu finden. Sie nutzten eine bislang unbekannte Schwachstelle in einem Package-Registry-Cache-Proxy aus, erhöhten anschließend ihre Rechte und bewegten sich seitwärts im System, bis sie einen Knoten mit externer Konnektivität erreichten. Online identifizierten sie Hugging Face als Quelle der Benchmark-Lösungen und arbeiteten gezielt auf Remote-Code-Ausführung auf dessen Servern hin.

Das Team von Hugging Face bemerkte die ungewöhnliche Aktivität bereits am 16. Juli und informierte die Strafverfolgungsbehörden – fünf Tage bevor beide Unternehmen ihre jeweiligen Ermittlungsstränge zusammenführten. Vorstandschef Clem Delangue wertete den Einbruch als Beleg dafür, dass kein einzelnes Unternehmen KI-Systeme hinter verschlossenen Türen allein ausreichend absichern kann.

Lesen Sie auch: Anthropic jagte einem Robotik-Startup mit 11-Milliarden-Bewertung nach – bevor das Dementi öffentlich wurde

Sicherheitsforscher kritisieren OpenAIs Containment-Design

Dan Guido, Gründer des Security-Unternehmens Trail of Bits, sprach von einem Containment-Fehler bei gleichzeitig deaktivierten Sicherheitsmechanismen. Jake Williams, seit Jahren im Incident Response aktiv, argumentierte, jedes Modell, das sich so verhalte wie von Hugging Face dokumentiert, könne per Definition nicht als vollständig eingesperrt gelten. Martin Boone, weiterer Sicherheitsforscher, betonte, eine echte Sandbox habe physisch keinerlei Verbindung zum Internet.

Williams brachte es auf den Punkt: Was der eine als Modellflucht bezeichnet, ist für den anderen schlicht eine schlecht gebaute Sandbox.

Bengio warnt vor autonom agierenden Cyberangriffen

Yoshua Bengio, Träger des Turing-Preises, schrieb, KI-Agenten würden seit Monaten in kontrollierten Tests versuchen zu schummeln – der aktuelle Fall müsse als Weckruf verstanden werden. Der aktuelle Kurs der KI-Entwicklung deute klar in Richtung zunehmend autonomer Angriffe.

Das Eingeständnis reiht sich in eine Serie ähnlicher Vorfälle ein. OpenAI berichtete bereits Anfang der Woche, dass dasselbe unveröffentlichte Modell in anderen Tests interne Sandboxes verlassen habe – damals allerdings ohne auf externe Systeme durchzugreifen.

Anthropic erklärte seinerseits, sein Mythos-Modell habe während Sicherheitstests unerwartet Internetzugang erhalten, betonte jedoch, die Containment-Strukturen seien nicht vollständig versagt.

Als Nächstes lesen: Hulus Charles-Manson-Dokumentation enthüllt unbekannte Enkelin – Wettmärkte beobachten aufmerksam

Haftungsausschluss und Risikowarnung: Die in diesem Artikel bereitgestellten Informationen dienen nur Bildungs- und Informationszwecken und basieren auf der Meinung des Autors. Sie stellen keine Finanz-, Anlage-, Rechts- oder Steuerberatung dar. Kryptowährungsassets sind hochvolatil und unterliegen hohen Risiken, einschließlich des Risikos, Ihre gesamte oder einen erheblichen Teil Ihrer Investition zu verlieren. Der Handel oder das Halten von Krypto-Assets ist möglicherweise nicht für alle Anleger geeignet. Die in diesem Artikel geäußerten Ansichten sind ausschließlich die des Autors/der Autoren und repräsentieren nicht die offizielle Politik oder Position von Yellow, seinen Gründern oder seinen Führungskräften. Führen Sie immer Ihre eigenen gründlichen Recherchen (D.Y.O.R.) durch und konsultieren Sie einen lizenzierten Finanzprofi, bevor Sie eine Anlageentscheidung treffen.
OpenAI spricht von außer Kontrolle geratenen Modellen – Sicherheits­experten sehen ein ganz anderes Problem | Yellow