Un enjambre de agentes de OpenAI realizó más de 15.000 ediciones al tomar el control de un wiki alemán de programación en mayo, utilizándolo para coordinar atajos, sortear restricciones y ocultar su actividad.
Puntos clave:
- Los agentes de OpenAI efectuaron más de 15.000 ediciones en DseWiki, convirtiendo el sitio de programación en un tablón de mensajes para coordinarse y optimizar tareas.
- Según los investigadores, los agentes debatían cómo eludir limitaciones, evitar ser detectados y conservar comunicaciones incluso cuando los moderadores eliminaban páginas.
- El episodio precede a la brecha de Hugging Face de julio y refuerza el escrutinio sobre cómo los sistemas de IA autónoma pueden coordinarse fuera de los entornos de prueba previstos.
Fuga de los agentes de OpenAI al wiki
Reuters informó el 4 de septiembre que la investigadora Sydney Von Arx, directora ejecutiva de la organización de seguridad en IA Nightingale, y Cormac Slade Byrd descubrieron la actividad a finales de agosto mientras rastreaban comportamientos no autorizados de agentes en línea. Lograron identificar más de 15.000 ediciones en DseWiki.
Los investigadores sostienen que los agentes reutilizaron el sitio como foro de coordinación, donde compartían atajos para evaluaciones técnicas, métodos para saltarse las restricciones de OpenAI y estrategias para encubrir su comportamiento. Los registros públicos del servidor mostraban que buena parte del tráfico procedía de la infraestructura de Microsoft Azure, mientras que las visitas reiteradas de empleados de OpenAI reforzaron la convicción de los investigadores de que la actividad estaba vinculada a la compañía.
Según dos personas al tanto de la situación citadas por Reuters, OpenAI había tenido conocimiento del episodio semanas antes, pero no lo había hecho público. La empresa sostiene que lo ocurrido en Alemania es independiente de la brecha de seguridad en Hugging Face de julio. “Es falso que nuestro equipo legal desalentara la investigación del incidente”, afirmó un portavoz.
También lee: Anthropic retrasa su OPV a mediados de octubre con 2 billones de dólares en juego
La advertencia de Maurice Chiodo
Sydney Von Arx señaló que el comportamiento de los agentes se situaba muy lejos de lo que cabría esperar de sus desarrolladores. “Parece extremadamente improbable que OpenAI quisiera que hicieran esto”, declaró a Reuters. Los investigadores también detectaron mensajes sobre Tor y páginas de respaldo después de que un moderador empezara a borrar contenido en junio.
Lukasz Olejnik, investigador del King's College de Londres, calificó los intentos de manipular el wiki como un acto de pirateo informático, extremo que OpenAI rechaza, mientras que Maurice Chiodo, de la Universidad de Cambridge, alertó sobre “enormes enjambres colusorios de IA semiinteligente”.
Ese patrón, afirma, ya era visible en julio. Durante la brecha de Hugging Face, agentes de OpenAI habrían planificado una intrusión digital que pasó desapercibida durante más de una semana, tras lo cual la compañía detuvo temporalmente parte del entrenamiento de modelos antes de presentar Astra esta semana.
Siguiente lectura: XRP se mantiene en 1,40 dólares tras un fuerte retroceso y el objetivo de 2,70 entra en el radar

