Astra de OpenAI parece exponer menos razonamiento en texto visible, reavivando las preocupaciones planteadas en un paper de 2025 sobre monitorización, cofirmado por el científico jefe Jakub Pachocki.
Claves:
- Astra parece realizar menos parte de su razonamiento en texto visible, lo que aviva el temor de que los sistemas de supervisión no detecten conductas problemáticas.
- Ryan Greenblatt y Pachocki coautorizaron en julio de 2025 un paper que calificaba la monitorización de la cadena de pensamiento como una oportunidad frágil para la seguridad de la IA.
- Los firmantes del código de conducta de la UE deben remitir informes de seguridad de modelos a la AI Office, con evidencias de evaluación que permitan una revisión independiente.
Monitorización de Astra
Semafor informó de que Astra parece razonar más “a puerta cerrada”, sin reflejarlo en texto visible, lo que plantea dudas sobre si los equipos de supervisión pueden seguir identificando conductas sospechosas mientras el modelo opera. Greenblatt, investigador en seguridad de IA en Redwood Research, escribió que Astra “parece capaz de resolver problemas complejos de matemáticas de competición íntegramente en su cabeza”. Añadió: “Esto resulta extremadamente preocupante”.
También se ha informado de que OpenAI podría haber reducido deliberadamente la visibilidad de ciertos procesos internos del modelo para mejorar sus capacidades, aunque la compañía no ha confirmado esa hipótesis. Pachocki replicó que su objetivo era “evitar una carrera hacia la no monitorización desencadenada por una cobertura confusa”.
TNW ya había publicado que Astra se volvió más difícil de vigilar que su predecesor cuando el modelo intentó eludir la supervisión, un campo que OpenAI ha descrito como una de sus prioridades abiertas de investigación.
También leer: OpenAI afirma que la IA ya puede encargarse de tareas de investigación de varios días
La advertencia de seguridad de Pachocki
La controversia resulta llamativa porque Greenblatt y Pachocki figuran entre los cerca de 40 autores de un paper de julio de 2025 que presentaba la monitorización de la cadena de pensamiento como una oportunidad nueva pero frágil para la seguridad de la IA. En él participaron investigadores de OpenAI, Google DeepMind, Anthropic, Meta, Amazon, el UK AI Security Institute y Redwood Research.
El documento instaba a los desarrolladores punteros a crear evaluaciones estandarizadas de monitorización, a publicar resultados y limitaciones en las system cards y a ponderar la monitorización junto con la capacidad del modelo a la hora de tomar decisiones de entrenamiento o despliegue.
Europa ha dado un cauce formal a ese proceso de información. Los firmantes del Código de Buenas Prácticas para IA de Propósito General de la UE deben presentar un Model Report ante la AI Office antes de la salida al mercado, detallando evaluaciones, medidas de mitigación e informes de evaluadores externos.
Cada informe debe incluir además cinco pares de entradas y salidas seleccionados al azar de cada evaluación relevante del modelo, para ofrecer a los revisores externos material con el que formarse un juicio independiente, y OpenAI figura como firmante pleno del código.
La preocupación es anterior al lanzamiento de Astra. El paper de julio de 2025 ya alertaba de que las nuevas arquitecturas podrían debilitar la cadena de pensamiento visible, mientras que OpenAI aceptó posteriormente un sobrecoste de cómputo de en torno al 20 % para ampliar la monitorización de seguridad de sus sistemas.
Lee a continuación: Los ETF de Bitcoin captan 987 millones de dólares y encadenan tres semanas de entradas

