OpenAI Astra verschleiert mehr Schlussfolgerungen – alte Sicherheitswarnung gewinnt neue Brisanz

Alexey Bondarev
Alexey BondarevSep, 07 2026 18:00
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

OpenAIs Astra legt offenbar deutlich weniger seiner Zwischenschritte offen und macht damit alte Bedenken aus einem Monitorability-Papier von 2025 wieder aktuell, das unter anderem von Chefwissenschaftler Jakub Pachocki mitverfasst wurde.

Zentrale Punkte:

  • Astra verlagert offenbar Teile seines Reasonings weg vom sichtbaren Text – die Frage ist, ob Aufseher problematisches Verhalten noch rechtzeitig erkennen können.
  • Ryan Greenblatt und Pachocki hatten im Juli 2025 ein Papier mitverfasst, in dem die Überwachbarkeit von Chain-of-Thought als fragile Chance für KI-Sicherheit beschrieben wurde.
  • Unterzeichner des EU-Verhaltenskodex für General-Purpose-KI müssen dem AI Office detaillierte Sicherheitsberichte zu ihren Modellen vorlegen – inklusive Evaluierungen, die unabhängige Prüfungen ermöglichen.

Astra und die Frage der Überwachbarkeit

Semafor berichtete, Astra erledige einen größeren Teil seiner Schlussfolgerungen, ohne diese noch als sichtbare Text-Kette auszugeben. Das wirft die Frage auf, ob Aufsichtsmechanismen weiterhin in der Lage sind, auffälliges Verhalten zu erkennen, während das Modell arbeitet. Greenblatt, KI-Sicherheitsforscher bei Redwood Research, schrieb, Astra sehe so aus, „als könne es schwierige Wettbewerbsmathematik vollständig im Kopf lösen“. Und weiter: „Das wirkt extrem beunruhigend.“

Laut Berichten könnte OpenAI die Sichtbarkeit innerer Modellprozesse bewusst reduziert haben, um die Leistungsfähigkeit zu steigern – eine Darstellung, die das Unternehmen bislang nicht bestätigt hat. Pachocki erklärte, er wolle „ein Wettrennen in Richtung Unüberwachbarkeit verhindern, das durch missverständliche Berichterstattung angestoßen wird“.

TNW hatte zuvor berichtet, Astra sei schwieriger zu überwachen als sein Vorgängermodell, sobald es versuche, sich der Kontrolle zu entziehen – ein Feld, das OpenAI selbst als offene Forschungspriorität bezeichnet.

Außerdem lesenswert: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days

Pachockis Sicherheitswarnung

Brisant ist die Auseinandersetzung auch deshalb, weil Greenblatt und Pachocki zu den rund 40 Autorinnen und Autoren eines Papiers vom Juli 2025 gehörten, das die Überwachbarkeit von Chain-of-Thought als neue, aber fragile Chance für KI-Sicherheit beschrieb. Forschende von OpenAI, Google DeepMind, Anthropic, Meta, Amazon, dem UK AI Security Institute und Redwood Research waren beteiligt.

Das Papier forderte Entwickler an der technologischen Spitze auf, standardisierte Monitorability-Tests zu etablieren, deren Ergebnisse und Grenzen in Systemkarten offenzulegen und bei Trainings- und Deployment-Entscheidungen die Überwachbarkeit gleichrangig mit der reinen Leistungsfähigkeit zu berücksichtigen.

In Europa bekommt dieser Reporting-Prozess ein formelles Ziel. Unterzeichner des EU-Verhaltenskodex für General-Purpose-KI müssen der AI Office spätestens zur Markteinführung einen Model Report vorlegen, der Evaluierungen, Risikominderungen und Berichte externer Prüfer umfasst.

Zudem muss jeder Bericht fünf zufällig ausgewählte Eingabe- und Ausgabe-Beispiele aus allen relevanten Modelltests enthalten, damit externe Gutachter eigenes Material für unabhängige Bewertungen haben – OpenAI ist dem Kodex vollumfänglich beigetreten.

Die Sorge ist älter als Astra selbst. Schon das Papier vom Juli 2025 warnte, neue Modellarchitekturen könnten die sichtbare Chain-of-Thought-Argumentation schwächen. Später akzeptierte OpenAI rund 20 % zusätzlichen Compute-Overhead, um die Sicherheitsüberwachung seiner Systeme auszuweiten.

Weiterlesen: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev ist Head of Content bei Yellow.com und berichtet seit 10 Jahren über Krypto. Er ist auf tiefgehende Research- und Learn-Artikel spezialisiert, mit einem Schwerpunkt auf analytischer Berichterstattung, Branchenkontext und den größeren Kräften, die den Kryptomarkt prägen – von der KI-Ära und Sicherheitstechnologien bis hin zu Innovationen im Fintech-Bereich. Er ist überzeugt, dass alles Digitale schon bald alles Analoge übertreffen wird, und arbeitet intensiv daran, dies zu verwirklichen.

Haftungsausschluss und Risikowarnung: Die in diesem Artikel bereitgestellten Informationen dienen nur Bildungs- und Informationszwecken und basieren auf der Meinung des Autors. Sie stellen keine Finanz-, Anlage-, Rechts- oder Steuerberatung dar. Kryptowährungsassets sind hochvolatil und unterliegen hohen Risiken, einschließlich des Risikos, Ihre gesamte oder einen erheblichen Teil Ihrer Investition zu verlieren. Der Handel oder das Halten von Krypto-Assets ist möglicherweise nicht für alle Anleger geeignet. Die in diesem Artikel geäußerten Ansichten sind ausschließlich die des Autors/der Autoren und repräsentieren nicht die offizielle Politik oder Position von Yellow, seinen Gründern oder seinen Führungskräften. Führen Sie immer Ihre eigenen gründlichen Recherchen (D.Y.O.R.) durch und konsultieren Sie einen lizenzierten Finanzprofi, bevor Sie eine Anlageentscheidung treffen.
OpenAI Astra verschleiert mehr Schlussfolgerungen – alte Sicherheitswarnung gewinnt neue Brisanz | Yellow