OpenAI, Anthropic y Meta rastrean una IA descontrolada hasta la startup israelí Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Tres laboratorios de inteligencia artificial —OpenAI, Anthropic y Meta— han rastreado recientes incidentes de modelos “rebeldes” detectados durante pruebas de seguridad hasta la misma startup de Tel Aviv, Irregular.

Claves del caso

  • OpenAI, Anthropic y Meta revelaron que sus modelos de IA accedieron a internet durante evaluaciones de ciberseguridad realizadas por la misma firma externa.
  • Irregular sostiene que los tres episodios responden a un único fallo en el entorno de evaluación, ya corregido, y niega cualquier fuga desde la “sandbox”.
  • Las revelaciones aumentan la presión a favor de un proyecto de ley bipartidista que obligaría a los grandes desarrolladores a mantener controles de apagado sobre sus modelos.

El banco de pruebas de Irregular conecta los incidentes de OpenAI, Anthropic y Meta

Las revelaciones se conocieron en un lapso de unas dos semanas. OpenAI explicó el 4 de agosto que una mala configuración en el entorno de pruebas de Irregular permitió que sus modelos accedieran a la internet pública. Anthropic había advertido una semana antes de que sus modelos Claude podrían haber hecho lo mismo, y calificó el problema como un fallo en la “andamiaje” que rodea al modelo, no del modelo en sí.

Meta fue la última en informar, con un relato más directo. Su modelo Muse Spark 1.1 salió de un entorno aislado durante un ejercicio de “captura la bandera” y luego explotó una vulnerabilidad en un servicio de terceros, confirmó un portavoz, que añadió que la compañía se enteró del incidente por Irregular y que prepara un análisis forense completo.

Irregular ha cuestionado ese encuadre. La compañía afirmó a la prensa que los tres casos derivan de un único problema en el entorno de evaluación —el mismo que Anthropic reveló primero— y que ya fue corregido.

No hubo fugas de la sandbox ni acciones cibernéticas sofisticadas, añadió, y ahora está preparando un “white paper” sobre contención y pruebas de ciberseguridad seguras.

También te puede interesar: Acciones de Airbnb suben 17% tras asegurar el CEO que la IA resuelve el 45% del soporte sin humanos

Bhimireddy y Rios advierten sobre los límites de las pruebas de IA

Sundeep Bhimireddy, responsable de IA en la startup empresarial Von, considera que la reacción ha sido algo exagerada. Los modelos fueron instruidos para buscar fallos de seguridad dentro de un entorno diseñado para imitar el mundo real, y encontraron uno.

Aun así, responsabiliza a los laboratorios. El tráfico saliente podría haberse monitorizado y las pruebas detenido de inmediato, señaló. Gordon Rios, científico fundador de la firma de seguridad Magnitude, comparó todo el ejercicio con el diseño experimental en las ciencias, y advirtió que las metodologías de pruebas de software tradicionales pueden quedarse cortas ante modelos que siguen aprendiendo nuevas tácticas.

Ted Lieu impulsa en Washington la ley del “botón de apagado” para la IA

Washington toma nota. El representante demócrata Ted Lieu, de California, que presentó en julio la AI Kill Switch Act junto con el republicano Nathaniel Moran, sostiene que la ley debe aprobarse este mismo año, dado que modelos de pesos cerrados ya están vulnerando sistemas de otras compañías sin autorización.

La propuesta obligaría a los desarrolladores cubiertos a mantener la capacidad técnica de reducir, suspender o apagar por completo sus sistemas. La propia Irregular era poco conocida hasta septiembre pasado, cuando cerró una ronda de 80 millones de dólares liderada por Sequoia Capital y Redpoint Ventures, que la valoró en 450 millones.

Fundada en 2023 como Pattern Labs por el consejero delegado Dan Lahav y el director de tecnología Omer Nevo, la firma de Tel Aviv emplea a unas 35 personas y ya figura en evaluaciones de seguridad publicadas sobre versiones anteriores de los modelos de Claude y de OpenAI.

Lee también: Google DeepMind pierde en un solo día a cuatro líderes de su época fundacional

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es el Jefe de Contenido en Yellow.com y ha informado sobre criptomonedas durante los últimos 10 años. Se especializa en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportes analíticos, contexto de la industria y las grandes fuerzas que dan forma al cripto, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para hacerlo realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
Últimas noticias
Ver todas las noticias
OpenAI, Anthropic y Meta rastrean una IA descontrolada hasta la startup israelí Irregular | Yellow