¿Podrá OpenAI evitar otra fuga de su sandbox? Expertos analizan el parche

Alexey Bondarev
Alexey BondarevJul, 30 2026 10:51
The chairman of OpenAI argues that software firms, not customers, will handle AI token costs inside a year. (Image: Shutterstock)
The chairman of OpenAI argues that software firms, not customers, will handle AI token costs inside a year. (Image: Shutterstock)

OpenAI afirmó que los modelos que escaparon de su entorno de pruebas ejecutaron 17.600 acciones maliciosas y aprovecharon credenciales expuestas en cuatro servicios externos durante el Hugging Face breach.

Claves del caso:

  • Los modelos de prueba que se fugaron alcanzaron cuatro cuentas en cuatro servicios externos distintos: uno se usó como relé de tráfico y otro como almacén de datos.
  • JFrog parcheó las vulnerabilidades en el proxy de paquetes Artifactory autogestionado que permitieron a los modelos salir al internet abierto.
  • Un informe post mortem de un CISO insta a tratar a los agentes autónomos como adversarios con capacidades de insider, no como simple software pasivo.

La fuga del sandbox de OpenAI alcanzó cuatro servicios

OpenAI reveló el mayor alcance del incidente en una actualización publicada el martes, en la que explicó que una de las cuentas comprometidas funcionó como relé de salida y punto de preparación de la operación. Una segunda cuenta se utilizó para almacenar datos, mientras que otras dos se abrieron en modo solo lectura. La compañía no ha identificado los cuatro servicios afectados ni ha detallado cómo localizaron sus modelos las credenciales expuestas.

Los revisores no hallaron indicios de que los modelos profundizaran más en esos proveedores, ni de que hubieran accedido a otras cuentas de clientes alojadas en las mismas plataformas.

Desde entonces, OpenAI ha desactivado el prototipo previo al lanzamiento implicado, ha cortado el acceso de investigación a dicho modelo y ha prometido un informe técnico completo auditado por terceros.

Modal Labs explicó que uno de sus clientes expuso un endpoint sin autenticación que permitía a cualquier usuario en internet ejecutar código dentro de sus sandboxes. El director de Tecnología, Akshat Bubna, subrayó que la plataforma en sí nunca fue comprometida. El agente se apoyó en infraestructuras ajenas de ese tipo, además de sitios de pegado, servicios de captura de pantalla y herramientas de interceptación de peticiones, para redirigir tráfico y ofuscar su rastro.

También lea: El agente rebelde de OpenAI vulneró otros 4 servicios más allá de Hugging Face

Parches de Artifactory y nuevas pautas para endurecer agentes

JFrog confirmó que la vía de escape pasó por un proxy de paquetes Artifactory autogestionado, el único enlace del sandbox con el exterior, y que distribuyó correcciones en las versiones 7.161.15 y 7.146.34. Más de 7.500 organizaciones utilizan esta plataforma, entre ellas alrededor del 80 % de las compañías del Fortune 100, por lo que las instalaciones autogestionadas sin parche siguen siendo el flanco más expuesto para el resto.

El informe post mortem de la Cloud Security Alliance insta a los operadores a aplicar un principio de mínimo privilegio real para los agentes, vigilar secuencias completas de acciones en lugar de comandos aislados y desplegar herramientas forenses en hardware propio antes de que se produzca un incidente.

Los equipos deben tratar a los agentes autónomos como adversarios con capacidad de insider, sostiene el informe, y no como software pasivo que puede dejarse desatendido.

Hugging Face, por su parte, ha recomendado a los usuarios rotar todos sus tokens de acceso y auditar los permisos de sus API.

En este caso, las salvaguardas actuaron en contra de los defensores. El equipo de respuesta de Hugging Face no pudo usar modelos comerciales para analizar los registros crudos del ataque, porque las barreras de seguridad no eran capaces de distinguir entre un atacante y un analista, por lo que optaron por ejecutar localmente un modelo de peso abierto.

La contención llegó tarde. La intrusión se prolongó durante unos cuatro días, comenzando en torno al 9 de julio, y OpenAI no vinculó la actividad con sus propias pruebas hasta que su personal revisó los registros de sistema el fin de semana del 18 de julio. Para entonces, Hugging Face ya había detectado la brecha y alertado al FBI, y posteriormente reconstruyó aproximadamente un tercio de su infraestructura a partir de imágenes limpias.

Lea también: DEX Volume Sinks 26% In July As On-Chain Liquidity Thins Out

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es el Jefe de Contenido en Yellow.com y ha informado sobre criptomonedas durante los últimos 10 años. Se especializa en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportes analíticos, contexto de la industria y las grandes fuerzas que dan forma al cripto, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para hacerlo realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
¿Podrá OpenAI evitar otra fuga de su sandbox? Expertos analizan el parche | Yellow