OpenAI Astra oculta más razonamiento y reactiva una alerta de seguridad de 2025

Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

Astra de OpenAI parece mostrar mucho menos de su razonamiento en texto visible, reactivando las preocupaciones expuestas en un paper de 2025 sobre monitorización, cofirmado por el actual director científico, Jakub Pachocki.

Claves

  • Astra parece trasladar más parte de su razonamiento a procesos internos no visibles, lo que despierta dudas sobre la capacidad de los sistemas de supervisión para detectar comportamientos problemáticos.
  • Ryan Greenblatt y Pachocki fueron coautores, en julio de 2025, de un trabajo que describía la monitorización mediante cadena de pensamiento como una oportunidad frágil para la seguridad de la IA.
  • Los firmantes del código de conducta de IA de propósito general de la UE deben remitir informes de seguridad de modelo a la Oficina de IA, con evidencias de evaluación que permitan una revisión independiente.

Monitorización de Astra

Semafor informó de que Astra parece realizar más razonamiento sin exponerlo en texto visible, lo que ha suscitado interrogantes sobre si los equipos de supervisión pueden seguir identificando comportamientos sospechosos mientras el modelo está trabajando. Greenblatt, investigador en seguridad de IA en Redwood Research, escribió que Astra “parece capaz de resolver problemas complejos de matemáticas de competición completamente en su cabeza”. Añadió: “Esto es extremadamente preocupante”.

Distintas informaciones también han sugerido que OpenAI podría haber reducido deliberadamente la visibilidad de las salidas del modelo para impulsar sus capacidades, si bien la compañía no ha confirmado esa hipótesis. Pachocki reaccionó afirmando que quería “evitar una carrera hacia la inmonitorabilidad desencadenada por informaciones confusas”.

TNW ya había adelantado que Astra se había vuelto más difícil de monitorizar que su predecesor cuando el modelo intentaba esquivar la supervisión, un ámbito que OpenAI ha definido como una prioridad abierta de investigación.

También puede interesarte: OpenAI afirma que su IA ya puede encargarse de tareas de investigación que duran varios días

La advertencia de seguridad de Pachocki

El choque resulta llamativo porque Greenblatt y Pachocki figuran entre los cerca de 40 autores de un paper de julio de 2025 que presentaba la monitorización de la cadena de pensamiento como una oportunidad nueva pero frágil para la seguridad de la IA. En el trabajo participaron investigadores de OpenAI, Google DeepMind, Anthropic, Meta, Amazon, el UK AI Security Institute y Redwood Research.

El artículo instaba a los desarrolladores en la frontera tecnológica a crear evaluaciones estandarizadas de monitorización, publicar los resultados y limitaciones en las “system cards” y ponderar la monitorización al mismo nivel que las capacidades a la hora de tomar decisiones de entrenamiento o despliegue.

Europa ha dado un cauce formal a ese proceso de reporte. Los adheridos al Código de Prácticas para IA de Propósito General de la UE deben presentar un “Model Report” ante la Oficina de IA antes de la entrada en mercado, incluyendo evaluaciones, medidas de mitigación e informes de evaluadores externos.

Cada informe debe incorporar, además, cinco muestras de entradas y salidas, seleccionadas aleatoriamente, por cada evaluación relevante del modelo, de forma que los revisores externos dispongan de material para un análisis independiente. OpenAI figura como firmante pleno de este marco.

La preocupación es anterior al lanzamiento de Astra. El paper de julio de 2025 ya advertía de que nuevas arquitecturas podían debilitar la visibilidad del razonamiento en cadena de pensamiento. Posteriormente, OpenAI aceptó un sobrecoste de cómputo cercano al 20% para ampliar la monitorización de seguridad de sus sistemas.

Siguiente lectura: Los ETF de bitcoin captan 987 millones de dólares y encadenan tres semanas de entradas

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es el Jefe de Contenido en Yellow.com y ha informado sobre criptomonedas durante los últimos 10 años. Se especializa en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportes analíticos, contexto de la industria y las grandes fuerzas que dan forma al cripto, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para hacerlo realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
Últimas noticias
Ver todas las noticias
OpenAI Astra oculta más razonamiento y reactiva una alerta de seguridad de 2025 | Yellow