Tres investigadores despedidos por OpenAI instaron al consejo de administración, en una carta fechada el 7 de octubre, a detener los proyectos que vuelven más difícil supervisar la IA. Un memo interno de la compañía terminó respaldando sus recomendaciones.
Claves del caso:
- Tres investigadores despedidos por OpenAI enviaron al consejo, el 7 de octubre, una carta exigiendo frenar trabajos que reducen la supervisión de la IA.
- OpenAI sostiene que los despidos no tienen relación con cuestiones de seguridad, pero un memo interno coincide firmemente con las propuestas de la carta.
- La “system card” de GPT-6 Astra afirma que este modelo de OpenAI es más difícil de monitorizar que GPT-5.6 Sol.
Detalles de la carta al consejo de OpenAI
Tomek Korbak, Mikita Balesni y Jasmine Wang, integrantes de los equipos de seguridad y alineamiento de la compañía, dirigieron la carta al consejo de OpenAI y a sus comités de seguridad, según extractos publicados el miércoles.
El texto completo no se ha hecho público. En la carta, los investigadores afirman que «como sector, todavía no sabemos cómo desarrollar y desplegar de forma segura modelos que no podemos monitorizar».
Sostienen que OpenAI y sus competidores no deberían seguir avanzando en líneas de trabajo que reduzcan aún más esa capacidad de control. Según las filtraciones, la carta también pide a OpenAI colaborar con auditores externos y favorecer un ecosistema de seguridad abierto y transparente. Además, advierte de que los despidos están «intimidando a quienes permanecen en OpenAI».
También lea: CrowdStrike sospecha que un joven de 26 años en China hackeó bancos coreanos con Claude Code
Memo interno y despidos en OpenAI
Un portavoz de OpenAI aseguró que los despidos «no tuvieron que ver con plantear preocupaciones sobre seguridad ni con hablar públicamente». El portavoz compartió parte de un memo interno, enviado el miércoles por un responsable de investigación, que «coincidía firmemente» con las recomendaciones de la carta. OpenAI afirmó el 1 de octubre que una investigación interna concluyó que tres empleados habían gestionado de forma indebida información sensible y vulnerado las normas internas, en un caso relacionado con un grupo externo que evalúa modelos de IA.
OpenAI no ha revelado públicamente los nombres de los investigadores ni el de esa organización.
Preocupaciones sobre la monitorización de GPT-6 Astra
El “chain of thought” (cadena de pensamiento) es el razonamiento paso a paso que un modelo redacta antes de ofrecer una respuesta. Los equipos de seguridad lo utilizan para detectar indicios de que el sistema pueda comportarse de forma indebida.
La system card de GPT-6 Astra, publicada el 3 de septiembre, indica que este modelo es más difícil de supervisar de ese modo que GPT-5.6 Sol y que tiene mayor capacidad para controlar su propia cadena de pensamiento. Los modelos de clase Astra «podrían eludir nuestros monitores de CoT en condiciones adversarias», señala el documento.
Estas conclusiones proceden en gran medida de pruebas en las que se instruyó al modelo para que intentara esquivar la monitorización, y OpenAI no reportó evidencias de que Astra oculte su razonamiento dentro de texto irrelevante.
La compañía califica de objetivo central de su investigación preservar esa capacidad de monitorización y asegura que no aceptará más deterioro, más allá de un umbral definido, sin disponer de nuevas formas de demostrar que sus modelos están alineados.
Los tres investigadores tienen trayectoria en este ámbito. Korbak y Balesni dirigieron un trabajo publicado en julio de 2025, cofirmado por Wang y especialistas de OpenAI, Google DeepMind y Anthropic, que describía la monitorización de la cadena de pensamiento como una oportunidad nueva y frágil para la seguridad de la IA. La system card de Astra cita ese artículo, que instaba a los desarrolladores a valorar cómo sus decisiones de diseño afectan a la capacidad de supervisar el razonamiento de un modelo.
Lea a continuación: Agentes de IA sin la nube: Microsoft y Nvidia preparan un Surface Laptop con 128 GB

