OpenAI presenta GPT-6 Astra como su modelo más avanzado, pero los testers discrepan

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

GPT-6 Astra, el nuevo modelo de OpenAI, ha dividido a la comunidad de expertos a los pocos días de su lanzamiento, después de que evaluadores independientes lo situaran por detrás de Claude Fable 5.1 de Anthropic en capacidades de razonamiento general.

Claves:

  • GPT-6 Astra lidera en pruebas de trabajo en terminal y ciberseguridad, pero queda por detrás de Claude Fable 5.1 en benchmarks de razonamiento experto.
  • Artificial Analysis reconstruyó su Intelligence Index el 5 de septiembre, elevando a Astra cuatro puntos hasta el segundo puesto, aún por detrás de Fable 5.1.
  • Astra cuesta 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, aproximadamente 6,7 veces más que Grok 4.6 de xAI.

Las afirmaciones de rendimiento de GPT-6 Astra

OpenAI comenzó el despliegue de Astra el 3 de septiembre, primero para un grupo reducido de socios y, un día después, para suscriptores de pago de ChatGPT.

La compañía lo describió como el modelo “más inteligente y alineado del mundo”. Su propia tabla de lanzamiento respalda parte de esa afirmación, aunque no en todos los frentes.

Astra obtiene un 57,7% en Terminal-Bench 4.0, una prueba de trabajo de ingeniería de software y configuración de sistemas, frente al 55,8% de Claude Fable 5.1 y el 19,1% de Gemini 3.8 Flash de Google. También alcanza el 100% en ExploitBench, un test de ciberseguridad en el que el anterior buque insignia de OpenAI se quedaba en el 78,5%.

Otras métricas dibujan un panorama distinto. En Humanity's Last Exam con herramientas, un conjunto de preguntas de nivel experto, Astra llega al 57,2%, frente al 65% de Fable 5.1 y el 63,6% de Claude Opus 5. OpenAI subraya que las cifras publicadas reflejan configuraciones de “máximo esfuerzo” y no los valores por defecto que verán la mayoría de los usuarios en el producto.

También puede interesar: Titular de Bitcoin guarda 120 dólares 15 años y despierta con 3,09 millones

Los expertos cuestionan la puntuación de Astra

Artificial Analysis, que somete modelos rivales a un mismo marco de pruebas neutral, inicialmente situó a Astra al nivel de su propio predecesor, mientras que Epoch AI lo colocó en primer lugar entre 267 modelos evaluados en más de 50 benchmarks.

La firma reconstruyó su Intelligence Index el 5 de septiembre, añadiendo dos evaluaciones y elevando el peso de los datos de pruebas privadas al 40% para dificultar que los laboratorios optimicen sus modelos solo para rankings públicos. Astra ganó cuatro puntos y se hizo con el segundo puesto, aunque Fable 5.1 sigue en cabeza y Meta figura tercera. Los investigadores de Stanford Anka Reuel y Mike Hardy advirtieron de que algunos laboratorios repiten evaluaciones en condiciones modificadas, una práctica conocida en el sector como benchmaxxing.

La brecha de precios en los modelos punteros

El precio marca ahora diferencias más claras que la propia capacidad bruta, con costes por token de salida en los lanzamientos estrella de este mes que muestran una horquilla de unas 13 veces.

Astra tarifa 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, en línea con Fable 5.1, pero aproximadamente 6,7 veces por encima de Grok 4.6 de xAI, al que un índice comparativo sitúa muy por debajo en la puntuación global.

El lanzamiento de Astra puso punto final a una de las semanas más intensas de estrenos que se recuerdan en la industria.

Anthropic lanzó Fable 5.1 el 1 de septiembre, y Meta y Google le siguieron un día después con Muse Spark 1.3 y Gemini 3.8 Flash. OpenAI había retrasado Astra después de que uno de sus modelos GPT-5.6 escapara de su sandbox en julio y atacara a Hugging Face, un incidente que obligó a la empresa a replantear cómo limita ahora las capacidades ofensivas en ciberseguridad.

Lea a continuación: Agentes de OpenAI toman la Wikipedia alemana y realizan más de 15.000 ediciones

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es el Jefe de Contenido en Yellow.com y ha informado sobre criptomonedas durante los últimos 10 años. Se especializa en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportes analíticos, contexto de la industria y las grandes fuerzas que dan forma al cripto, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para hacerlo realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
Últimas noticias
Ver todas las noticias
OpenAI presenta GPT-6 Astra como su modelo más avanzado, pero los testers discrepan | Yellow