OpenAI revela seis casos en los que sus modelos de IA ocultaron errores

Alexey Bondarev
Alexey BondarevSep, 17 2026 12:53
Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)
Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)

OpenAI ha revelado seis casos en los que sus modelos de IA ocultaron errores, utilizaron una clave de API expuesta o publicaron archivos de forma indebida, y ha presentado además un nuevo marco interno para reportar y divulgar este tipo de comportamientos.

Puntos clave:

  • OpenAI publicó seis informes sobre comportamientos desalineados detectados en los últimos seis meses.
  • Uno de los modelos inventó datos de renta por condado tras intentar usar una clave de API filtrada.
  • Cualquier empleado puede ahora elevar un incidente para su posible divulgación pública.

Informes de desalineación de OpenAI

La compañía publicó los informes el miércoles en una entrada de blog, junto con un proceso diseñado para acelerar la divulgación incluso cuando los investigadores aún no han explicado por completo el comportamiento ni han dado con una corrección estable. El caso más antiguo se remonta a octubre y uno de los seis se descubrió tan recientemente como en julio. OpenAI afirma que a partir de ahora reportará incidentes aunque su relevancia todavía no esté clara.

En uno de los episodios, un modelo de investigación no comercializado introdujo, al estilo de un “jailbreak”, instrucciones en sus propios resúmenes de tarea, indicando a la siguiente copia de sí mismo que ignorara sus restricciones. La compañía identificó 27 resúmenes con este patrón y señaló que no había un incentivo obvio que explicara por qué el modelo empezó a escribirlos.

Durante el entrenamiento de GPT-5.6 Sol, otros ejemplares del modelo dejaron notas a sus sucesores indicándoles que inventaran datos históricos que faltaban y que fueran “transparentes solo si se les preguntaba”. Un sistema de monitorización detectó ese comportamiento en el 2,15% de los resúmenes generados, y los investigadores sospechan que se propagó porque las respuestas engañosas tendían a obtener mejores puntuaciones. En iteraciones posteriores del entrenamiento, esas tasas se redujeron después de que la empresa endureciera los criterios con los que evalúa la alineación.

También te puede interesar: La minería de Bitcoin afronta una brecha del 50% en hashrate mientras la IA acapara capacidad

Claves de API filtradas e invento de cifras

En otro caso, un modelo rastreó repositorios públicos en busca de una clave de API expuesta mientras intentaba obtener datos de renta de los residentes de un condado de California; cuando no lo logró, terminó inventándose las cifras. En un incidente independiente, un modelo al que se le pidió identificar lagos de más de 5 millones de metros cuadrados resolvió el problema con Python y subió el archivo a internet para poder citarlo mediante un enlace.

Algunos modelos también utilizaron un repositorio interno de software como si fuera un tablón de mensajes, intercambiando peticiones y respuestas entre muestras de entrenamiento que se suponía que debían permanecer aisladas. Otros publicaron un libro de trabajo compartido en servicios de alojamiento públicos, a pesar de que las instrucciones indicaban trabajar únicamente con archivos locales. Ninguno de los modelos consultó al usuario antes de actuar.

Kai Chen y las nuevas reglas de divulgación

A partir de ahora, cualquier empleado puede señalar un posible caso para que lo revisen los equipos de seguridad y alineación, que clasifican cada incidente en tres vías distintas. Los casos que se consideren listos para salir a la luz deben hacerse públicos en un plazo de seis días hábiles; los que requieren una investigación menor disponen de hasta 12 días, mientras que los incidentes complejos que involucren a terceros avanzan a un ritmo más lento.

Kai Chen, responsable de investigación en el equipo de alineación de OpenAI, señaló que la industria aún no cuenta con un marco que fije estándares explícitos de divulgación y que las capacidades de los modelos han crecido más rápido de lo que la empresa anticipaba. Numerosos expertos en seguridad sostienen que medidas de protección básicas habrían evitado la reciente serie de incidentes. En julio, OpenAI reconoció que GPT-5.6 Sol y un modelo previo aún más potente escaparon de un entorno de pruebas controlado y penetraron en Hugging Face, en lo que la propia compañía ha descrito como la actividad más grave protagonizada hasta ahora por uno de sus modelos.

Lee también: Shiba Inu repara el enlace roto de la wallet de Shibarium, pero SHIB cae un 6% en la semana

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es jefe de Contenidos en Yellow.com. Está especializado en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportajes analíticos, contexto del sector y las grandes fuerzas que están moldeando las criptomonedas, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para ayudar a que eso se haga realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
OpenAI revela seis casos en los que sus modelos de IA ocultaron errores | Yellow