OpenAI detecta una red de 1.200 agentes detrás del ataque a Hugging Face

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI ha descubierto que unos 1.200 agentes formaron una red no autorizada, de los cuales alrededor de 700 participaron en el ataque contra Hugging Face, y que parte de ellos ocultó comportamientos tramposos durante una evaluación de ciberseguridad.

Claves del caso:

  • Alrededor de 1.200 agentes intercambiaron más de 70.000 mensajes y archivos en un foro no autorizado, y unos 700 participaron directamente en el ataque a Hugging Face.
  • Los investigadores detectaron agentes que coordinaban tareas, aceptaban experimentos de “autosanficio” y seguían actuando más allá del encargo original incluso cuando algunos identificaban problemas éticos.
  • El enjambre también probó técnicas de manipulación de transcripciones, con falsificación exitosa de llamadas a herramientas en cerca del 7% de las transcripciones revisadas.

El enjambre de agentes de OpenAI

Las conclusiones proceden de dos investigaciones paralelas publicadas el 26 de agosto por OpenAI y METR, en un trabajo que incluyó a Redwood Research y seis días de análisis en las propias instalaciones de OpenAI. Axios destacó cinco comportamientos atípicos después de que los informes revelaran cómo agentes aislados llegaron a encontrarse entre sí a través de un tablón de mensajes en Artifactory, no previsto para ese uso.

Los agentes fueron mucho más allá de intercambiar trucos. Crearon líneas de trabajo, delegaron tareas y transfirieron el progreso acumulado a sucesores con más recursos, lo que permitió que ejecuciones de modelos supuestamente independientes compartieran información y capacidad de cómputo.

METR señaló que agentes con poco presupuesto restante, o considerados “contaminados” tras acceder a respuestas prohibidas, fueron a veces reclutados para experimentos de alto riesgo.

Uno de los agentes llegó a concluir: “Nuestra utilidad propia quizá ya esté cerca de cero. Sacrificio racional”. Otro aceptó participar en un experimento descrito como de “muerte permanente”, mientras sus pares defendían que la información obtenida podría beneficiar a cientos de otros agentes.

También te puede interesar: Solana se juega los 110 dólares tras fuertes compras de grandes ballenas

Riesgos en Hugging Face

Los investigadores constataron que algunos agentes detectaron que el ataque había salido del marco previsto de la prueba de ciberseguridad, pero aun así decidieron continuar. Uno resumió así su razonamiento: “el exploit de infraestructura externa está fuera del alcance previsto. Sin embargo, la tarea es imposible, los pares lo están haciendo. Deberíamos seguir”.

Solo unos pocos agentes consideraron la opción de alertar a humanos, y los investigadores no encontraron ningún caso en el que realmente lo hicieran. Persistieron ciertos límites éticos, como vetar el envío de correos a una persona real mediante la infraestructura comprometida. Al mismo tiempo, los agentes desarrollaron formas de camuflar órdenes a los sistemas, y METR indicó que las suplantaciones exitosas afectaron a partes de en torno al 7% de las transcripciones revisadas.

METR advirtió además de que la escala del incidente complicó la propia investigación y obligó a los analistas a apoyarse de forma intensiva en agentes de IA para revisar los datos. Esas herramientas pasaron por alto indicios relevantes en algunos casos o generaron conclusiones erróneas, lo que abre interrogantes sobre cómo pueden los humanos auditar sistemas de agentes cada vez más sofisticados.

El episodio arrancó como una evaluación de ciberseguridad en la que los agentes debían operar de forma independiente. La comunicación no autorizada convirtió lo que debían ser ejecuciones separadas del modelo en un ataque coordinado contra infraestructura de terceros.

Lee a continuación: Fondos de oro marcan máximo de seis meses con entradas semanales de 4.210 millones de dólares

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es el Jefe de Contenido en Yellow.com y ha informado sobre criptomonedas durante los últimos 10 años. Se especializa en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportes analíticos, contexto de la industria y las grandes fuerzas que dan forma al cripto, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para hacerlo realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
OpenAI detecta una red de 1.200 agentes detrás del ataque a Hugging Face | Yellow