OpenAI Astra verschleiert mehr Denkvorgänge und belebt Sicherheitswarnung von 2025 neu

Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

OpenAIs Astra scheint deutlich weniger von seinen Denkvorgängen offen zu legen – und rückt damit Sicherheitsbedenken wieder in den Fokus, die bereits in einem Monitorability-Paper aus dem Jahr 2025 formuliert wurden, an dem auch Chefwissenschaftler Jakub Pachocki mitgeschrieben hat.

Zentrale Punkte:

  • Astra verlagert offenbar mehr seiner Schlussfolgerungen in nicht sichtbare Prozesse. Das wirft die Frage auf, ob Aufseher problematisches Verhalten noch zuverlässig erkennen können.
  • Ryan Greenblatt und Pachocki waren Mitautoren eines Papiers vom Juli 2025, das die Überwachung von Chain-of-Thought als fragile Chance für KI-Sicherheit einstufte.
  • Unterzeichner des EU-Verhaltenskodex für Basismodelle müssen dem AI Office Sicherheitsberichte zu ihren Modellen vorlegen – inklusive Evaluierungen, die unabhängige Prüfungen ermöglichen.

Überwachbarkeit von Astra

Semafor berichtet, dass Astra zunehmend im Verborgenen „nachdenkt“, statt seine Zwischenschritte in Klartext auszugeben. Das wirft die Frage auf, ob Prüfsysteme verdächtiges Verhalten überhaupt noch während der Laufzeit erkennen können. Greenblatt, KI-Sicherheitsforscher bei Redwood Research, schrieb, Astra wirke, „als könne es schwierige Wettbewerbs-Mathematikaufgaben vollständig im Kopf lösen“. Und weiter: „Das erscheint extrem beunruhigend.“

Berichte deuten zudem darauf hin, dass OpenAI die Sichtbarkeit der Modell-Ausgaben bewusst reduziert haben könnte, um die Leistungsfähigkeit zu steigern – eine Darstellung, die das Unternehmen bislang weder bestätigt noch dementiert hat. Pachocki reagierte mit dem Hinweis, er wolle „einen Wettlauf in Richtung Unüberwachbarkeit verhindern, der durch missverständliche Berichterstattung ausgelöst wird“.

TNW hatte zuvor gemeldet, dass Astra schwieriger zu überwachen sei als sein Vorgänger, sobald das Modell versuche, sich der Kontrolle zu entziehen – ein Feld, das OpenAI selbst als offene Forschungspriorität bezeichnet.

Außerdem lesenswert: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days

Pachockis Sicherheitswarnung

Die Auseinandersetzung wiegt besonders schwer, weil Greenblatt und Pachocki zu den rund 40 Autoren eines Papiers vom Juli 2025 gehören, das die Überwachbarkeit von Chain-of-Thought als neues, aber fragiles Zeitfenster für KI-Sicherheit beschreibt. Forschende von OpenAI, Google DeepMind, Anthropic, Meta, Amazon, dem UK AI Security Institute und Redwood Research waren beteiligt.

Das Paper forderte Entwickler fortgeschrittener Modelle auf, standardisierte Monitorability-Evaluierungen zu etablieren, Ergebnisse und Grenzen in Systemkarten transparent zu machen und die Überwachbarkeit bei Trainings- und Deployment-Entscheidungen gleichrangig neben der reinen Leistungsfähigkeit zu berücksichtigen.

In Europa bekommt dieser Berichtsprozess einen formalen Adressaten: Unterzeichner des EU-Verhaltenskodex für General-Purpose-AI müssen dem AI Office spätestens zum Markteintritt einen Model Report vorlegen. Dieser umfasst Evaluierungen, Risikominderungen sowie Berichte externer Prüfer.

Jeder Bericht muss zudem fünf zufällig ausgewählte Eingabe- und Ausgabebeispiele aus jeder relevanten Modellbewertung enthalten, damit externe Gutachter die Resultate eigenständig prüfen können. OpenAI gehört zu den vollständigen Unterzeichnern des Kodex.

Die Sorge reicht weiter zurück als den Start von Astra. Bereits im Juli 2025 warnte das Paper, dass neue Modellarchitekturen die sichtbare Chain-of-Thought-Argumentation ausdünnen könnten. OpenAI akzeptierte später rund 20 % zusätzlichen Rechenaufwand, um erweiterte Sicherheitsüberwachung seiner Systeme zu ermöglichen.

Als Nächstes lesen: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev ist Head of Content bei Yellow.com und berichtet seit 10 Jahren über Krypto. Er ist auf tiefgehende Research- und Learn-Artikel spezialisiert, mit Schwerpunkt auf analytischer Berichterstattung, Branchenkontext und den größeren Kräften, die den Kryptomarkt prägen – von der KI-Ära und Sicherheitstechnologien bis hin zu Innovationen im Fintech-Bereich. Er ist überzeugt, dass alles Digitale in naher Zukunft alles Analoge überholen wird, und arbeitet intensiv daran, dies Wirklichkeit werden zu lassen.

Haftungsausschluss und Risikowarnung: Die in diesem Artikel bereitgestellten Informationen dienen nur Bildungs- und Informationszwecken und basieren auf der Meinung des Autors. Sie stellen keine Finanz-, Anlage-, Rechts- oder Steuerberatung dar. Kryptowährungsassets sind hochvolatil und unterliegen hohen Risiken, einschließlich des Risikos, Ihre gesamte oder einen erheblichen Teil Ihrer Investition zu verlieren. Der Handel oder das Halten von Krypto-Assets ist möglicherweise nicht für alle Anleger geeignet. Die in diesem Artikel geäußerten Ansichten sind ausschließlich die des Autors/der Autoren und repräsentieren nicht die offizielle Politik oder Position von Yellow, seinen Gründern oder seinen Führungskräften. Führen Sie immer Ihre eigenen gründlichen Recherchen (D.Y.O.R.) durch und konsultieren Sie einen lizenzierten Finanzprofi, bevor Sie eine Anlageentscheidung treffen.