OpenAI Astra oculta más razonamiento y reactiva una advertencia de seguridad de 2025

Alexey Bondarev
Alexey BondarevSep, 07 2026 18:00
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

Astra de OpenAI parece exponer menos razonamiento en texto visible, reavivando las preocupaciones planteadas en un paper de 2025 sobre monitorización, cofirmado por el científico jefe Jakub Pachocki.

Claves:

  • Astra parece realizar menos parte de su razonamiento en texto visible, lo que aviva el temor de que los sistemas de supervisión no detecten conductas problemáticas.
  • Ryan Greenblatt y Pachocki coautorizaron en julio de 2025 un paper que calificaba la monitorización de la cadena de pensamiento como una oportunidad frágil para la seguridad de la IA.
  • Los firmantes del código de conducta de la UE deben remitir informes de seguridad de modelos a la AI Office, con evidencias de evaluación que permitan una revisión independiente.

Monitorización de Astra

Semafor informó de que Astra parece razonar más “a puerta cerrada”, sin reflejarlo en texto visible, lo que plantea dudas sobre si los equipos de supervisión pueden seguir identificando conductas sospechosas mientras el modelo opera. Greenblatt, investigador en seguridad de IA en Redwood Research, escribió que Astra “parece capaz de resolver problemas complejos de matemáticas de competición íntegramente en su cabeza”. Añadió: “Esto resulta extremadamente preocupante”.

También se ha informado de que OpenAI podría haber reducido deliberadamente la visibilidad de ciertos procesos internos del modelo para mejorar sus capacidades, aunque la compañía no ha confirmado esa hipótesis. Pachocki replicó que su objetivo era “evitar una carrera hacia la no monitorización desencadenada por una cobertura confusa”.

TNW ya había publicado que Astra se volvió más difícil de vigilar que su predecesor cuando el modelo intentó eludir la supervisión, un campo que OpenAI ha descrito como una de sus prioridades abiertas de investigación.

También leer: OpenAI afirma que la IA ya puede encargarse de tareas de investigación de varios días

La advertencia de seguridad de Pachocki

La controversia resulta llamativa porque Greenblatt y Pachocki figuran entre los cerca de 40 autores de un paper de julio de 2025 que presentaba la monitorización de la cadena de pensamiento como una oportunidad nueva pero frágil para la seguridad de la IA. En él participaron investigadores de OpenAI, Google DeepMind, Anthropic, Meta, Amazon, el UK AI Security Institute y Redwood Research.

El documento instaba a los desarrolladores punteros a crear evaluaciones estandarizadas de monitorización, a publicar resultados y limitaciones en las system cards y a ponderar la monitorización junto con la capacidad del modelo a la hora de tomar decisiones de entrenamiento o despliegue.

Europa ha dado un cauce formal a ese proceso de información. Los firmantes del Código de Buenas Prácticas para IA de Propósito General de la UE deben presentar un Model Report ante la AI Office antes de la salida al mercado, detallando evaluaciones, medidas de mitigación e informes de evaluadores externos.

Cada informe debe incluir además cinco pares de entradas y salidas seleccionados al azar de cada evaluación relevante del modelo, para ofrecer a los revisores externos material con el que formarse un juicio independiente, y OpenAI figura como firmante pleno del código.

La preocupación es anterior al lanzamiento de Astra. El paper de julio de 2025 ya alertaba de que las nuevas arquitecturas podrían debilitar la cadena de pensamiento visible, mientras que OpenAI aceptó posteriormente un sobrecoste de cómputo de en torno al 20 % para ampliar la monitorización de seguridad de sus sistemas.

Lee a continuación: Los ETF de Bitcoin captan 987 millones de dólares y encadenan tres semanas de entradas

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es el Jefe de Contenido en Yellow.com y ha cubierto el sector cripto durante los últimos 10 años. Está especializado en investigaciones y artículos educativos en profundidad, con un enfoque en el análisis, el contexto de la industria y las grandes fuerzas que están dando forma al cripto, desde la era de la IA y las tecnologías de seguridad hasta la innovación en fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja duro para ayudar a que eso se haga realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.