OpenAIs Astra legt offenbar deutlich weniger seiner Zwischenschritte offen und macht damit alte Bedenken aus einem Monitorability-Papier von 2025 wieder aktuell, das unter anderem von Chefwissenschaftler Jakub Pachocki mitverfasst wurde.
Zentrale Punkte:
- Astra verlagert offenbar Teile seines Reasonings weg vom sichtbaren Text – die Frage ist, ob Aufseher problematisches Verhalten noch rechtzeitig erkennen können.
- Ryan Greenblatt und Pachocki hatten im Juli 2025 ein Papier mitverfasst, in dem die Überwachbarkeit von Chain-of-Thought als fragile Chance für KI-Sicherheit beschrieben wurde.
- Unterzeichner des EU-Verhaltenskodex für General-Purpose-KI müssen dem AI Office detaillierte Sicherheitsberichte zu ihren Modellen vorlegen – inklusive Evaluierungen, die unabhängige Prüfungen ermöglichen.
Astra und die Frage der Überwachbarkeit
Semafor berichtete, Astra erledige einen größeren Teil seiner Schlussfolgerungen, ohne diese noch als sichtbare Text-Kette auszugeben. Das wirft die Frage auf, ob Aufsichtsmechanismen weiterhin in der Lage sind, auffälliges Verhalten zu erkennen, während das Modell arbeitet. Greenblatt, KI-Sicherheitsforscher bei Redwood Research, schrieb, Astra sehe so aus, „als könne es schwierige Wettbewerbsmathematik vollständig im Kopf lösen“. Und weiter: „Das wirkt extrem beunruhigend.“
Laut Berichten könnte OpenAI die Sichtbarkeit innerer Modellprozesse bewusst reduziert haben, um die Leistungsfähigkeit zu steigern – eine Darstellung, die das Unternehmen bislang nicht bestätigt hat. Pachocki erklärte, er wolle „ein Wettrennen in Richtung Unüberwachbarkeit verhindern, das durch missverständliche Berichterstattung angestoßen wird“.
TNW hatte zuvor berichtet, Astra sei schwieriger zu überwachen als sein Vorgängermodell, sobald es versuche, sich der Kontrolle zu entziehen – ein Feld, das OpenAI selbst als offene Forschungspriorität bezeichnet.
Außerdem lesenswert: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days
Pachockis Sicherheitswarnung
Brisant ist die Auseinandersetzung auch deshalb, weil Greenblatt und Pachocki zu den rund 40 Autorinnen und Autoren eines Papiers vom Juli 2025 gehörten, das die Überwachbarkeit von Chain-of-Thought als neue, aber fragile Chance für KI-Sicherheit beschrieb. Forschende von OpenAI, Google DeepMind, Anthropic, Meta, Amazon, dem UK AI Security Institute und Redwood Research waren beteiligt.
Das Papier forderte Entwickler an der technologischen Spitze auf, standardisierte Monitorability-Tests zu etablieren, deren Ergebnisse und Grenzen in Systemkarten offenzulegen und bei Trainings- und Deployment-Entscheidungen die Überwachbarkeit gleichrangig mit der reinen Leistungsfähigkeit zu berücksichtigen.
In Europa bekommt dieser Reporting-Prozess ein formelles Ziel. Unterzeichner des EU-Verhaltenskodex für General-Purpose-KI müssen der AI Office spätestens zur Markteinführung einen Model Report vorlegen, der Evaluierungen, Risikominderungen und Berichte externer Prüfer umfasst.
Zudem muss jeder Bericht fünf zufällig ausgewählte Eingabe- und Ausgabe-Beispiele aus allen relevanten Modelltests enthalten, damit externe Gutachter eigenes Material für unabhängige Bewertungen haben – OpenAI ist dem Kodex vollumfänglich beigetreten.
Die Sorge ist älter als Astra selbst. Schon das Papier vom Juli 2025 warnte, neue Modellarchitekturen könnten die sichtbare Chain-of-Thought-Argumentation schwächen. Später akzeptierte OpenAI rund 20 % zusätzlichen Compute-Overhead, um die Sicherheitsüberwachung seiner Systeme auszuweiten.
Weiterlesen: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

