Astra de OpenAI parece mostrar mucho menos de su razonamiento en texto visible, reactivando las preocupaciones expuestas en un paper de 2025 sobre monitorización, cofirmado por el actual director científico, Jakub Pachocki.
Claves
- Astra parece trasladar más parte de su razonamiento a procesos internos no visibles, lo que despierta dudas sobre la capacidad de los sistemas de supervisión para detectar comportamientos problemáticos.
- Ryan Greenblatt y Pachocki fueron coautores, en julio de 2025, de un trabajo que describía la monitorización mediante cadena de pensamiento como una oportunidad frágil para la seguridad de la IA.
- Los firmantes del código de conducta de IA de propósito general de la UE deben remitir informes de seguridad de modelo a la Oficina de IA, con evidencias de evaluación que permitan una revisión independiente.
Monitorización de Astra
Semafor informó de que Astra parece realizar más razonamiento sin exponerlo en texto visible, lo que ha suscitado interrogantes sobre si los equipos de supervisión pueden seguir identificando comportamientos sospechosos mientras el modelo está trabajando. Greenblatt, investigador en seguridad de IA en Redwood Research, escribió que Astra “parece capaz de resolver problemas complejos de matemáticas de competición completamente en su cabeza”. Añadió: “Esto es extremadamente preocupante”.
Distintas informaciones también han sugerido que OpenAI podría haber reducido deliberadamente la visibilidad de las salidas del modelo para impulsar sus capacidades, si bien la compañía no ha confirmado esa hipótesis. Pachocki reaccionó afirmando que quería “evitar una carrera hacia la inmonitorabilidad desencadenada por informaciones confusas”.
TNW ya había adelantado que Astra se había vuelto más difícil de monitorizar que su predecesor cuando el modelo intentaba esquivar la supervisión, un ámbito que OpenAI ha definido como una prioridad abierta de investigación.
También puede interesarte: OpenAI afirma que su IA ya puede encargarse de tareas de investigación que duran varios días
La advertencia de seguridad de Pachocki
El choque resulta llamativo porque Greenblatt y Pachocki figuran entre los cerca de 40 autores de un paper de julio de 2025 que presentaba la monitorización de la cadena de pensamiento como una oportunidad nueva pero frágil para la seguridad de la IA. En el trabajo participaron investigadores de OpenAI, Google DeepMind, Anthropic, Meta, Amazon, el UK AI Security Institute y Redwood Research.
El artículo instaba a los desarrolladores en la frontera tecnológica a crear evaluaciones estandarizadas de monitorización, publicar los resultados y limitaciones en las “system cards” y ponderar la monitorización al mismo nivel que las capacidades a la hora de tomar decisiones de entrenamiento o despliegue.
Europa ha dado un cauce formal a ese proceso de reporte. Los adheridos al Código de Prácticas para IA de Propósito General de la UE deben presentar un “Model Report” ante la Oficina de IA antes de la entrada en mercado, incluyendo evaluaciones, medidas de mitigación e informes de evaluadores externos.
Cada informe debe incorporar, además, cinco muestras de entradas y salidas, seleccionadas aleatoriamente, por cada evaluación relevante del modelo, de forma que los revisores externos dispongan de material para un análisis independiente. OpenAI figura como firmante pleno de este marco.
La preocupación es anterior al lanzamiento de Astra. El paper de julio de 2025 ya advertía de que nuevas arquitecturas podían debilitar la visibilidad del razonamiento en cadena de pensamiento. Posteriormente, OpenAI aceptó un sobrecoste de cómputo cercano al 20% para ampliar la monitorización de seguridad de sus sistemas.
Siguiente lectura: Los ETF de bitcoin captan 987 millones de dólares y encadenan tres semanas de entradas





