Drei von OpenAI entlassene Forscher haben den Aufsichtsrat in einem Schreiben vom 7. Oktober aufgefordert, Projekte zu stoppen, die es erschweren, KI-Systeme zu überwachen. Ein internes Firmen-Memo stellt sich nun ausdrücklich hinter diese Empfehlungen.
Zentrale Punkte:
- Drei von OpenAI entlassene Forscher forderten den Aufsichtsrat am 7. Oktober auf, Arbeiten zu stoppen, die die Überwachbarkeit von KI verringern.
- OpenAI betont, die Kündigungen stünden nicht im Zusammenhang mit Sicherheitsbedenken; ein internes Memo unterstützt die Empfehlungen des Schreibens jedoch deutlich.
- Die Systemkarte für GPT-6 Astra weist aus, dass das OpenAI-Modell schwieriger zu überwachen ist als GPT-5.6 Sol.
Details zum Schreiben an den OpenAI-Aufsichtsrat
Tomek Korbak, Mikita Balesni und Jasmine Wang, die bei OpenAI an Sicherheit und Alignment arbeiteten, adressierten ihren Brief laut Auszügen, die am Mittwoch veröffentlicht wurden, an den Aufsichtsrat und die Sicherheitsgremien des Unternehmens.
Der vollständige Text ist bislang nicht öffentlich. Die Forscher schreiben darin, „dass wir als Branche noch nicht wissen, wie wir Modelle, die wir nicht überwachen können, sicher entwickeln und einsetzen sollen“.
OpenAI und Wettbewerber sollten daher keine Forschungsrichtungen verfolgen, die diese Überwachbarkeit weiter einschränken, argumentieren sie. Dem Vernehmen nach fordert der Brief zudem, mit unabhängigen Prüfern zusammenzuarbeiten und ein offenes, transparentes Sicherheitsökosystem zu fördern. Die Entlassungen hätten eine „abschreckende Wirkung auf diejenigen, die bei OpenAI verbleiben“, heißt es weiter.
Außerdem lesenswert: CrowdStrike verdächtigt 26-Jährigen in China, koreanische Banken mit Claude Code gehackt zu haben
OpenAI-Memo und Kündigungen
Eine OpenAI-Sprecherin erklärte, die Kündigungen „hingen nicht damit zusammen, dass Sicherheitsbedenken geäußert oder Missstände angesprochen wurden“. Sie veröffentlichte Auszüge aus einem internen Memo eines Forschungsleiters, das am Mittwoch verschickt wurde und den Empfehlungen des Briefes „nachdrücklich zustimmt“. OpenAI erklärte am 1. Oktober, eine interne Untersuchung habe ergeben, dass drei Mitarbeitende sensible Informationen unsachgemäß gehandhabt und damit gegen Unternehmensrichtlinien verstoßen hätten – in einem Fall, der eine externe Gruppe betraf, die KI-Modelle evaluiert.
Namen der Forscher oder der betreffenden Organisation hat OpenAI bislang nicht öffentlich gemacht.
Überwachungsrisiken bei GPT-6 Astra
„Chain of thought“ bezeichnet die schrittweise Begründung, die ein Modell vor seiner eigentlichen Antwort niederschreibt. Sicherheitsteams analysieren diese Gedankenkette, um Hinweise darauf zu finden, ob ein System beabsichtigt, sich missbräuchlich zu verhalten.
In der am 3. September veröffentlichten Systemkarte für GPT-6 Astra heißt es, das Modell sei auf diese Weise schwerer zu überwachen als GPT-5.6 Sol und in höherem Maße in der Lage, seine eigene Gedankenkette zu kontrollieren. Astra-Modelle „könnten unsere CoT-Monitore unter adversarialen Bedingungen umgehen“, heißt es dort.
Diese Erkenntnisse stammen überwiegend aus Tests, in denen das Modell explizit angewiesen wurde, der Überwachung auszuweichen. OpenAI berichtet zugleich, man habe keine Hinweise darauf gefunden, dass Astra seine Begründungen in scheinbar zusammenhanglosen Texten verstecke.
Die Sicherung dieser Überwachbarkeit sei ein zentrales Forschungsziel, schreibt das Unternehmen. Man werde keinen weiteren Verlust jenseits eines definierten Grenzwerts akzeptieren, solange es keine neuen Methoden gebe, die Ausrichtung der Modelle überzeugend nachzuweisen.
Die drei entlassenen Forscher sind in dem Themenfeld einschlägig ausgewiesen. Korbak und Balesni führten im Juli 2025 eine Studie an, die sie gemeinsam mit Wang und Forschern von OpenAI, Google DeepMind und Anthropic verfassten. Darin wird Chain-of-Thought-Monitoring als neue, zugleich aber fragile Chance für die KI-Sicherheit beschrieben. Die Astra-Systemkarte verweist ausdrücklich auf diese Arbeit, die Entwickler auffordert, bei Architekturentscheidungen systematisch zu berücksichtigen, wie stark sie die Möglichkeit beeinflussen, die Begründungen eines Modells nachzuvollziehen.
Als Nächstes lesen: KI-Agenten ohne Cloud: Microsoft und Nvidia rüsten ein Surface Laptop mit 128 GB auf

