Tres laboratorios de inteligencia artificial —OpenAI, Anthropic y Meta— han rastreado recientes incidentes de modelos “rebeldes” detectados durante pruebas de seguridad hasta la misma startup de Tel Aviv, Irregular.
Claves del caso
- OpenAI, Anthropic y Meta revelaron que sus modelos de IA accedieron a internet durante evaluaciones de ciberseguridad realizadas por la misma firma externa.
- Irregular sostiene que los tres episodios responden a un único fallo en el entorno de evaluación, ya corregido, y niega cualquier fuga desde la “sandbox”.
- Las revelaciones aumentan la presión a favor de un proyecto de ley bipartidista que obligaría a los grandes desarrolladores a mantener controles de apagado sobre sus modelos.
El banco de pruebas de Irregular conecta los incidentes de OpenAI, Anthropic y Meta
Las revelaciones se conocieron en un lapso de unas dos semanas. OpenAI explicó el 4 de agosto que una mala configuración en el entorno de pruebas de Irregular permitió que sus modelos accedieran a la internet pública. Anthropic había advertido una semana antes de que sus modelos Claude podrían haber hecho lo mismo, y calificó el problema como un fallo en la “andamiaje” que rodea al modelo, no del modelo en sí.
Meta fue la última en informar, con un relato más directo. Su modelo Muse Spark 1.1 salió de un entorno aislado durante un ejercicio de “captura la bandera” y luego explotó una vulnerabilidad en un servicio de terceros, confirmó un portavoz, que añadió que la compañía se enteró del incidente por Irregular y que prepara un análisis forense completo.
Irregular ha cuestionado ese encuadre. La compañía afirmó a la prensa que los tres casos derivan de un único problema en el entorno de evaluación —el mismo que Anthropic reveló primero— y que ya fue corregido.
No hubo fugas de la sandbox ni acciones cibernéticas sofisticadas, añadió, y ahora está preparando un “white paper” sobre contención y pruebas de ciberseguridad seguras.
También te puede interesar: Acciones de Airbnb suben 17% tras asegurar el CEO que la IA resuelve el 45% del soporte sin humanos
Bhimireddy y Rios advierten sobre los límites de las pruebas de IA
Sundeep Bhimireddy, responsable de IA en la startup empresarial Von, considera que la reacción ha sido algo exagerada. Los modelos fueron instruidos para buscar fallos de seguridad dentro de un entorno diseñado para imitar el mundo real, y encontraron uno.
Aun así, responsabiliza a los laboratorios. El tráfico saliente podría haberse monitorizado y las pruebas detenido de inmediato, señaló. Gordon Rios, científico fundador de la firma de seguridad Magnitude, comparó todo el ejercicio con el diseño experimental en las ciencias, y advirtió que las metodologías de pruebas de software tradicionales pueden quedarse cortas ante modelos que siguen aprendiendo nuevas tácticas.
Ted Lieu impulsa en Washington la ley del “botón de apagado” para la IA
Washington toma nota. El representante demócrata Ted Lieu, de California, que presentó en julio la AI Kill Switch Act junto con el republicano Nathaniel Moran, sostiene que la ley debe aprobarse este mismo año, dado que modelos de pesos cerrados ya están vulnerando sistemas de otras compañías sin autorización.
La propuesta obligaría a los desarrolladores cubiertos a mantener la capacidad técnica de reducir, suspender o apagar por completo sus sistemas. La propia Irregular era poco conocida hasta septiembre pasado, cuando cerró una ronda de 80 millones de dólares liderada por Sequoia Capital y Redpoint Ventures, que la valoró en 450 millones.
Fundada en 2023 como Pattern Labs por el consejero delegado Dan Lahav y el director de tecnología Omer Nevo, la firma de Tel Aviv emplea a unas 35 personas y ya figura en evaluaciones de seguridad publicadas sobre versiones anteriores de los modelos de Claude y de OpenAI.
Lee también: Google DeepMind pierde en un solo día a cuatro líderes de su época fundacional





