OpenAI-Memo stützt Schreiben vom 7. Oktober – von Forschern verfasst, die kurz darauf entlassen wurden

Three researchers fired by OpenAI urged its board in an Oct. 7 letter to halt harder-to-monitor AI work, advice a company memo backed (Image: Shutterstock)
Three researchers fired by OpenAI urged its board in an Oct. 7 letter to halt harder-to-monitor AI work, advice a company memo backed (Image: Shutterstock)

Drei von OpenAI entlassene Forscher haben den Aufsichtsrat in einem Schreiben vom 7. Oktober aufgefordert, Projekte zu stoppen, die es erschweren, KI-Systeme zu überwachen. Ein internes Firmen-Memo stellt sich nun ausdrücklich hinter diese Empfehlungen.

Zentrale Punkte:

  • Drei von OpenAI entlassene Forscher forderten den Aufsichtsrat am 7. Oktober auf, Arbeiten zu stoppen, die die Überwachbarkeit von KI verringern.
  • OpenAI betont, die Kündigungen stünden nicht im Zusammenhang mit Sicherheitsbedenken; ein internes Memo unterstützt die Empfehlungen des Schreibens jedoch deutlich.
  • Die Systemkarte für GPT-6 Astra weist aus, dass das OpenAI-Modell schwieriger zu überwachen ist als GPT-5.6 Sol.

Details zum Schreiben an den OpenAI-Aufsichtsrat

Tomek Korbak, Mikita Balesni und Jasmine Wang, die bei OpenAI an Sicherheit und Alignment arbeiteten, adressierten ihren Brief laut Auszügen, die am Mittwoch veröffentlicht wurden, an den Aufsichtsrat und die Sicherheitsgremien des Unternehmens.

Der vollständige Text ist bislang nicht öffentlich. Die Forscher schreiben darin, „dass wir als Branche noch nicht wissen, wie wir Modelle, die wir nicht überwachen können, sicher entwickeln und einsetzen sollen“.

OpenAI und Wettbewerber sollten daher keine Forschungsrichtungen verfolgen, die diese Überwachbarkeit weiter einschränken, argumentieren sie. Dem Vernehmen nach fordert der Brief zudem, mit unabhängigen Prüfern zusammenzuarbeiten und ein offenes, transparentes Sicherheitsökosystem zu fördern. Die Entlassungen hätten eine „abschreckende Wirkung auf diejenigen, die bei OpenAI verbleiben“, heißt es weiter.

Außerdem lesenswert: CrowdStrike verdächtigt 26-Jährigen in China, koreanische Banken mit Claude Code gehackt zu haben

OpenAI-Memo und Kündigungen

Eine OpenAI-Sprecherin erklärte, die Kündigungen „hingen nicht damit zusammen, dass Sicherheitsbedenken geäußert oder Missstände angesprochen wurden“. Sie veröffentlichte Auszüge aus einem internen Memo eines Forschungsleiters, das am Mittwoch verschickt wurde und den Empfehlungen des Briefes „nachdrücklich zustimmt“. OpenAI erklärte am 1. Oktober, eine interne Untersuchung habe ergeben, dass drei Mitarbeitende sensible Informationen unsachgemäß gehandhabt und damit gegen Unternehmensrichtlinien verstoßen hätten – in einem Fall, der eine externe Gruppe betraf, die KI-Modelle evaluiert.

Namen der Forscher oder der betreffenden Organisation hat OpenAI bislang nicht öffentlich gemacht.

Überwachungsrisiken bei GPT-6 Astra

„Chain of thought“ bezeichnet die schrittweise Begründung, die ein Modell vor seiner eigentlichen Antwort niederschreibt. Sicherheitsteams analysieren diese Gedankenkette, um Hinweise darauf zu finden, ob ein System beabsichtigt, sich missbräuchlich zu verhalten.

In der am 3. September veröffentlichten Systemkarte für GPT-6 Astra heißt es, das Modell sei auf diese Weise schwerer zu überwachen als GPT-5.6 Sol und in höherem Maße in der Lage, seine eigene Gedankenkette zu kontrollieren. Astra-Modelle „könnten unsere CoT-Monitore unter adversarialen Bedingungen umgehen“, heißt es dort.

Diese Erkenntnisse stammen überwiegend aus Tests, in denen das Modell explizit angewiesen wurde, der Überwachung auszuweichen. OpenAI berichtet zugleich, man habe keine Hinweise darauf gefunden, dass Astra seine Begründungen in scheinbar zusammenhanglosen Texten verstecke.

Die Sicherung dieser Überwachbarkeit sei ein zentrales Forschungsziel, schreibt das Unternehmen. Man werde keinen weiteren Verlust jenseits eines definierten Grenzwerts akzeptieren, solange es keine neuen Methoden gebe, die Ausrichtung der Modelle überzeugend nachzuweisen.

Die drei entlassenen Forscher sind in dem Themenfeld einschlägig ausgewiesen. Korbak und Balesni führten im Juli 2025 eine Studie an, die sie gemeinsam mit Wang und Forschern von OpenAI, Google DeepMind und Anthropic verfassten. Darin wird Chain-of-Thought-Monitoring als neue, zugleich aber fragile Chance für die KI-Sicherheit beschrieben. Die Astra-Systemkarte verweist ausdrücklich auf diese Arbeit, die Entwickler auffordert, bei Architekturentscheidungen systematisch zu berücksichtigen, wie stark sie die Möglichkeit beeinflussen, die Begründungen eines Modells nachzuvollziehen.

Als Nächstes lesen: KI-Agenten ohne Cloud: Microsoft und Nvidia rüsten ein Surface Laptop mit 128 GB auf

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev ist Head of Content bei Yellow.com. Er ist auf tiefgehende Research- und Learn-Beiträge spezialisiert, mit einem Schwerpunkt auf analytischer Berichterstattung, Branchenkontext und den großen Kräften, die Krypto prägen – von der KI-Ära und Sicherheitstechnologien bis hin zu Fintech-Innovation. Er ist überzeugt, dass alles Digitale in naher Zukunft alles Analoge überholen wird und arbeitet intensiv daran, dies Wirklichkeit werden zu lassen.

Haftungsausschluss und Risikowarnung: Die in diesem Artikel bereitgestellten Informationen dienen nur Bildungs- und Informationszwecken und basieren auf der Meinung des Autors. Sie stellen keine Finanz-, Anlage-, Rechts- oder Steuerberatung dar. Kryptowährungsassets sind hochvolatil und unterliegen hohen Risiken, einschließlich des Risikos, Ihre gesamte oder einen erheblichen Teil Ihrer Investition zu verlieren. Der Handel oder das Halten von Krypto-Assets ist möglicherweise nicht für alle Anleger geeignet. Die in diesem Artikel geäußerten Ansichten sind ausschließlich die des Autors/der Autoren und repräsentieren nicht die offizielle Politik oder Position von Yellow, seinen Gründern oder seinen Führungskräften. Führen Sie immer Ihre eigenen gründlichen Recherchen (D.Y.O.R.) durch und konsultieren Sie einen lizenzierten Finanzprofi, bevor Sie eine Anlageentscheidung treffen.
OpenAI-Memo stützt Schreiben vom 7. Oktober – von Forschern verfasst, die kurz darauf entlassen wurden | Yellow