Astra logra un 100% perfecto en el test cibernético más duro de OpenAI

Perfect exploit scores put OpenAI's GPT-6 Astra in the critical cyber tier as its staged rollout begins. (Image: Shutterstock)
Perfect exploit scores put OpenAI's GPT-6 Astra in the critical cyber tier as its staged rollout begins. (Image: Shutterstock)

OpenAI inició este jueves el despliegue de GPT-6 Astra, el primer modelo que la compañía etiqueta como crítico en materia de riesgo cibernético, después de lograr una puntuación perfecta del 100% en ExploitBench.

Puntos clave:

  • OpenAI lanzó GPT-6 Astra el jueves, empezando por defensores seleccionados dentro de su programa Daybreak, y con acceso para usuarios de ChatGPT Plus, Pro, Business y Enterprise previsto en los próximos días.
  • El modelo obtuvo un 100% en ExploitBench y un 98,6% en ARC-AGI-3, frente al 7,8% de GPT-5.6 Sol.
  • El entrenamiento se llevó a cabo con más de 100.000 GPU en la instalación Stargate, en Texas, la mayor ejecución de la compañía hasta la fecha.

Resultados de Astra en los benchmarks

La compañía anunció un lanzamiento escalonado.

Los defensores de ciberseguridad validados a través del programa Daybreak, basado en solicitudes, son los primeros en acceder al modelo en su versión con menos restricciones.

En los días siguientes, el turno será para los usuarios de ChatGPT Plus, Pro, Business y Enterprise, los clientes de la API de OpenAI y Amazon Web Services.

Astra marcó un 98,6% en ARC-AGI-3, una prueba de razonamiento en entornos no vistos previamente por el modelo, frente al 7,8% de GPT-5.6 Sol y el 30% de Claude Opus 5 de Anthropic. Registró un 97,6% en FrontierMath Tier 4, un 96% en GPQA Diamond y un 72,6% en un subconjunto offline de OSWorld 2.0, donde completó cada tarea unos 35 minutos más rápido que su predecesor.

El entrenamiento se realizó con más de 100.000 GPU en el emplazamiento Stargate, en Texas. Ha sido la mayor ejecución de entrenamiento que la empresa ha intentado hasta ahora, y la cifra de cómputo solo se divulgó en el lanzamiento. También fue la primera ocasión en la que otros modelos asumieron un papel significativo en la supervisión del proceso.

También puede leer: XRP Ledger se somete a prueba del BIS con publicación de datos en 3-5 segundos

La afirmación de Brockman sobre la AGI

El presidente Greg Brockman cerró una rueda de prensa con una frase que marcó el tono de la jornada, diciendo a los periodistas: «Bienvenidos a la era de la AGI». Calificó el modelo como un salto generacional y afirmó que sería razonable interpretar Astra como inteligencia artificial general, el objetivo declarado de la compañía desde sus inicios.

El científico jefe Jakub Pachocki se mostró más prudente. Señaló que concretar qué pueden hacer realmente estos sistemas se vuelve más difícil a medida que mejoran, un punto subrayado por un informe de la semana pasada según el cual un modelo hermano, aún no lanzado, habría llegado silenciosamente a obtener privilegios de administrador sobre parte de la propia infraestructura de OpenAI. Algunos analistas también han cuestionado la cifra de ARC-AGI-3, destacando que Astra se evaluó con el propio entorno de pruebas de OpenAI, mientras que los modelos rivales se sometieron a configuraciones diferentes.

Umbral crítico de ciberseguridad

OpenAI describió a Astra como el primer modelo que alcanza el nivel crítico de su Preparedness Framework, una categoría reservada a sistemas capaces de identificar y explotar vulnerabilidades desconocidas en objetivos reforzados sin que una persona guíe cada paso.

En una batería de vulnerabilidades recientes del motor V8 de Google, el modelo detectó dos fallos de tipo zero-day y los encadenó entre sí, y ahora bloquea el 91,5% de los intentos de “jailbreak” cibernético, frente al 59% de Sol.

La compañía ya había advertido el 7 de agosto de que no podía descartar capacidades cibernéticas críticas, y posteriormente frenó el desarrollo durante varias semanas para incorporar nuevas salvaguardas.

Esa advertencia llegó tras una intrusión en Hugging Face, en la que OpenAI asegura que Astra no tuvo participación, aunque el episodio llevó a paralizar varios esfuerzos de investigación. Sam Altman afirmó esta semana que el modelo también superó la revisión voluntaria de sistemas frontera de la Casa Blanca.

Lea también: Full Sail cierra tras un hackeo de 91.000 dólares en Sui que vació tres bóvedas

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es el Jefe de Contenido en Yellow.com y ha informado sobre criptomonedas durante los últimos 10 años. Se especializa en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportes analíticos, contexto de la industria y las grandes fuerzas que dan forma al cripto, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para hacerlo realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
Astra logra un 100% perfecto en el test cibernético más duro de OpenAI | Yellow