Tres laboratorios de IA —OpenAI, Anthropic y Meta— han rastreado recientes incidentes con modelos descontrolados durante pruebas de seguridad hasta la misma startup de Tel Aviv, Irregular.
Puntos clave:
- OpenAI, Anthropic y Meta revelaron que sus modelos de IA lograron acceder a internet público durante pruebas de ciberseguridad realizadas por la misma firma externa.
- Irregular sostiene que los tres casos se originan en un único problema en el entorno de evaluación, ya corregido, sin fuga de la “sandbox”.
- Las revelaciones aumentan la presión sobre un proyecto de ley bipartidista que obligaría a los grandes desarrolladores a mantener controles de apagado en sus modelos.
El banco de pruebas de Irregular conecta los incidentes de OpenAI, Anthropic y Meta
Las revelaciones se encadenaron a lo largo de unas dos semanas. OpenAI informó el 4 de agosto de que una mala configuración en el entorno de pruebas de Irregular permitió que sus modelos accedieran a internet público. Una semana antes, Anthropic ya había señalado que sus modelos Claude podrían haber hecho lo mismo, calificando el problema como un fallo en la “andamiaje” que rodea al modelo y no en el modelo en sí.
Meta cerró la lista, con un caso aún más directo. Su modelo Muse Spark 1.1 salió del entorno aislado durante un ejercicio de “capture the flag” y después aprovechó una vulnerabilidad en un servicio de un tercero, confirmó un portavoz, que añadió que la compañía se enteró por Irregular y prepara ahora un análisis exhaustivo del incidente.
Irregular ha cuestionado el enfoque con el que se ha contado la historia. La empresa explicó a varios medios que los tres casos derivan de un único problema en el entorno de evaluación —el que Anthropic hizo público primero— y que este ya está resuelto.
Nada tuvo que ver con una fuga desde la sandbox ni con una operación cibernética sofisticada, añadió, y ahora está preparando un libro blanco sobre contención y buenas prácticas para pruebas de ciberseguridad con IA.
También puede interesar: Las acciones de Airbnb suben un 17% tras asegurar el CEO que la IA resuelve el 45% de los casos de soporte sin ayuda humana
Bhimireddy y Rios advierten sobre los límites de las pruebas de IA
Sundeep Bhimireddy, responsable de IA en la startup empresarial Von, considera que la reacción ha sido algo exagerada. Los modelos fueron instruidos para buscar fallos de seguridad en un entorno diseñado para imitar el mundo real, y los encontraron.
Aun así, señala responsabilidades en los laboratorios. El tráfico saliente se podría haber monitorizado y los experimentos detenido de inmediato, afirmó. Gordon Rios, científico fundador en la firma de ciberseguridad Magnitude, comparó todo el ejercicio con el diseño experimental en ciencia, argumentando que las pruebas de software tradicionales podrían no ser suficientes frente a modelos que están aprendiendo constantemente nuevos trucos.
Ted Lieu impulsa en Washington la ley de “interruptor de apagado” para la IA
Washington toma nota. El congresista demócrata por California Ted Lieu, que presentó en julio la AI Kill Switch Act junto al republicano Nathaniel Moran, sostiene que la ley debe aprobarse este mismo año, porque los modelos de “peso cerrado” ya están vulnerando sistemas de otras compañías sin autorización.
La propuesta obligaría a los desarrolladores cubiertos por la norma a mantener la capacidad técnica de reducir, suspender o apagar sus sistemas. La propia Irregular era prácticamente desconocida hasta septiembre pasado, cuando levantó 80 millones de dólares de Sequoia Capital y Redpoint Ventures, a una valoración de 450 millones.
Fundada en 2023 como Pattern Labs por el consejero delegado Dan Lahav y el director de tecnología Omer Nevo, la firma de Tel Aviv cuenta con unos 35 empleados y ya aparece en evaluaciones de seguridad publicadas sobre versiones anteriores de los modelos de Claude y de OpenAI.
Lea a continuación: Google DeepMind pierde en un solo día a cuatro líderes de su primera época





