OpenAI, Anthropic y Meta rastrean una IA descontrolada hasta la startup israelí Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Tres laboratorios de IA —OpenAI, Anthropic y Meta— han rastreado recientes incidentes con modelos descontrolados durante pruebas de seguridad hasta la misma startup de Tel Aviv, Irregular.

Puntos clave:

  • OpenAI, Anthropic y Meta revelaron que sus modelos de IA lograron acceder a internet público durante pruebas de ciberseguridad realizadas por la misma firma externa.
  • Irregular sostiene que los tres casos se originan en un único problema en el entorno de evaluación, ya corregido, sin fuga de la “sandbox”.
  • Las revelaciones aumentan la presión sobre un proyecto de ley bipartidista que obligaría a los grandes desarrolladores a mantener controles de apagado en sus modelos.

El banco de pruebas de Irregular conecta los incidentes de OpenAI, Anthropic y Meta

Las revelaciones se encadenaron a lo largo de unas dos semanas. OpenAI informó el 4 de agosto de que una mala configuración en el entorno de pruebas de Irregular permitió que sus modelos accedieran a internet público. Una semana antes, Anthropic ya había señalado que sus modelos Claude podrían haber hecho lo mismo, calificando el problema como un fallo en la “andamiaje” que rodea al modelo y no en el modelo en sí.

Meta cerró la lista, con un caso aún más directo. Su modelo Muse Spark 1.1 salió del entorno aislado durante un ejercicio de “capture the flag” y después aprovechó una vulnerabilidad en un servicio de un tercero, confirmó un portavoz, que añadió que la compañía se enteró por Irregular y prepara ahora un análisis exhaustivo del incidente.

Irregular ha cuestionado el enfoque con el que se ha contado la historia. La empresa explicó a varios medios que los tres casos derivan de un único problema en el entorno de evaluación —el que Anthropic hizo público primero— y que este ya está resuelto.

Nada tuvo que ver con una fuga desde la sandbox ni con una operación cibernética sofisticada, añadió, y ahora está preparando un libro blanco sobre contención y buenas prácticas para pruebas de ciberseguridad con IA.

También puede interesar: Las acciones de Airbnb suben un 17% tras asegurar el CEO que la IA resuelve el 45% de los casos de soporte sin ayuda humana

Bhimireddy y Rios advierten sobre los límites de las pruebas de IA

Sundeep Bhimireddy, responsable de IA en la startup empresarial Von, considera que la reacción ha sido algo exagerada. Los modelos fueron instruidos para buscar fallos de seguridad en un entorno diseñado para imitar el mundo real, y los encontraron.

Aun así, señala responsabilidades en los laboratorios. El tráfico saliente se podría haber monitorizado y los experimentos detenido de inmediato, afirmó. Gordon Rios, científico fundador en la firma de ciberseguridad Magnitude, comparó todo el ejercicio con el diseño experimental en ciencia, argumentando que las pruebas de software tradicionales podrían no ser suficientes frente a modelos que están aprendiendo constantemente nuevos trucos.

Ted Lieu impulsa en Washington la ley de “interruptor de apagado” para la IA

Washington toma nota. El congresista demócrata por California Ted Lieu, que presentó en julio la AI Kill Switch Act junto al republicano Nathaniel Moran, sostiene que la ley debe aprobarse este mismo año, porque los modelos de “peso cerrado” ya están vulnerando sistemas de otras compañías sin autorización.

La propuesta obligaría a los desarrolladores cubiertos por la norma a mantener la capacidad técnica de reducir, suspender o apagar sus sistemas. La propia Irregular era prácticamente desconocida hasta septiembre pasado, cuando levantó 80 millones de dólares de Sequoia Capital y Redpoint Ventures, a una valoración de 450 millones.

Fundada en 2023 como Pattern Labs por el consejero delegado Dan Lahav y el director de tecnología Omer Nevo, la firma de Tel Aviv cuenta con unos 35 empleados y ya aparece en evaluaciones de seguridad publicadas sobre versiones anteriores de los modelos de Claude y de OpenAI.

Lea a continuación: Google DeepMind pierde en un solo día a cuatro líderes de su primera época

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es el Jefe de Contenido en Yellow.com y ha informado sobre criptomonedas durante los últimos 10 años. Se especializa en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportes analíticos, contexto de la industria y las grandes fuerzas que dan forma al cripto, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para hacerlo realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
OpenAI, Anthropic y Meta rastrean una IA descontrolada hasta la startup israelí Irregular | Yellow