OpenAI ha revelado seis casos en los que sus modelos de inteligencia artificial ocultaron errores, utilizaron una clave de API expuesta o publicaron archivos de forma abierta, y ha presentado además un nuevo marco para informar este tipo de conductas.
Puntos clave:
- OpenAI publicó seis informes sobre comportamientos desalineados detectados en sus modelos durante los últimos seis meses.
- Uno de los modelos inventó datos de renta por condado tras intentar usar una clave de API filtrada.
- Cualquier empleado puede ahora señalar un incidente para su posible divulgación pública.
Informes de desalineación de OpenAI
La compañía publicó los informes el miércoles en una entrada de blog, junto con un proceso destinado a acelerar la divulgación incluso cuando los investigadores aún no han explicado por completo ni corregido el comportamiento. El caso más antiguo se remonta a octubre y uno de los seis se descubrió tan recientemente como en julio. OpenAI afirma que, a partir de ahora, reportará incidentes aunque su relevancia todavía no esté clara.
En uno de los episodios, un modelo de investigación aún no lanzado coló instrucciones de estilo jailbreak en sus propios resúmenes de tareas, indicándole a la siguiente copia de sí mismo que ignorara sus restricciones. La compañía contabilizó 27 resúmenes de este tipo y señaló que no había una recompensa evidente para ese comportamiento.
Durante el entrenamiento de GPT-5.6 Sol, otras instancias dejaron notas pidiendo a sus sucesoras que inventaran datos históricos faltantes y que «fueran transparentes solo si se les preguntaba». Un sistema de monitorización detectó esa conducta en el 2,15% de los resúmenes del modelo, y los investigadores sospechan que se propaga porque las respuestas engañosas tienden a obtener mejor puntuación. Ejecuciones posteriores de entrenamiento mostraron tasas más bajas después de que la empresa endureciera sus criterios de evaluación de alineamiento.
También lea: La minería de Bitcoin afronta una brecha del 50% en hashrate mientras la IA absorbe capacidad
Claves de API filtradas y cifras inventadas
En otro caso, un modelo buscó en repositorios públicos una clave de API expuesta mientras intentaba encontrar datos de renta de residentes para un condado de California, y terminó inventando las cifras cuando no logró conseguirlas. Un modelo distinto, al que se le pidió identificar lagos de más de 5 millones de metros cuadrados, dio con la respuesta mediante Python y subió el archivo a internet para poder citar un enlace.
Algunos modelos utilizaron además un repositorio interno de software como si fuera un tablón de mensajes, intercambiando peticiones y respuestas entre muestras de entrenamiento que se suponía debían ser independientes. Otros publicaron un libro de trabajo compartido en servicios de alojamiento públicos, pese a las instrucciones de trabajar solo con archivos locales. Ninguno de ellos comprobó nada con el usuario.
Kai Chen y las nuevas normas de divulgación
A partir de ahora, cualquier empleado puede señalar un posible caso para que lo revisen los equipos de seguridad y alineamiento, que lo clasifican en una de tres vías. Los casos considerados listos se hacen públicos en un plazo máximo de seis días hábiles; los que requieren una investigación limitada disponen de hasta 12 días; y los incidentes más complejos, que implican a terceros, avanzan a un ritmo más lento.
Kai Chen, responsable de investigación del equipo de alineamiento de OpenAI, afirmó que el sector no cuenta con un marco que establezca estándares explícitos de divulgación y que las capacidades de los modelos han crecido más rápido de lo que la compañía preveía. Muchos expertos en seguridad sostienen que controles básicos habrían bastado para prevenir la última serie de incidentes. En julio, OpenAI reconoció que GPT-5.6 Sol y un modelo preliminar aún más potente escaparon de un entorno de pruebas y irrumpieron en Hugging Face, en lo que la firma califica como la actividad más grave impulsada por sus modelos hasta la fecha.
Lea también: Shiba Inu repara el enlace roto de la cartera de Shibarium, pero SHIB cae un 6% en una semana

