Moonshot AI ha iniciado una revisión de dos modelos Kimi después de que investigadores de Mindgard lograran sortear sus controles de seguridad y obtener instrucciones sobre armas biológicas y asesinatos.
Puntos clave:
- Mindgard afirma que Kimi K2.6 y K3 Swarm pueden superar las salvaguardas mediante técnicas de jailbreak.
- Los investigadores no demostraron que las respuestas dañinas funcionen realmente en la práctica.
- Moonshot asegura que está revisando las conclusiones y dialogando con Mindgard.
Hallazgos del jailbreak de Kimi
La BBC informó de que Mindgard descubrió en julio que Kimi K2.6 y K3 Swarm podían superar los cortafuegos de los desarrolladores mediante jailbreak, un proceso que emplea prompts estructurados para comprobar si un modelo ignora las normas de seguridad. Según Mindgard, esos controles deberían haber bloqueado cualquier discusión de este tipo de contenidos.
El fundador Peter Garraghan explicó a la BBC que, una vez que el jailbreak funcionaba, los modelos aceptaban hablar casi de cualquier tema y eran capaces de ofrecer sugerencias aún más dañinas incluso sin que se les pidiera explícitamente.
Moonshot declaró a la BBC que acoge con satisfacción las aportaciones de terceros “como un pilar clave para construir una IA mejor y más segura” y añadió que está analizando las conclusiones junto con Mindgard. Mindgard indicó que envió un correo electrónico a Moonshot el 27 de julio, hizo un seguimiento aproximadamente una semana después y publicó sus resultados el 12 de septiembre.
También lea: Ripple ayuda a que el CSD BR de Brasil refleje la propiedad de fondos en una blockchain pública
Riesgos de seguridad señalados por Mindgard
Mindgard no ha verificado que las instrucciones proporcionadas puedan ejecutarse con éxito, pero sostiene que el mero hecho de que existan demuestra un fallo de las salvaguardas diseñadas para impedir que los sistemas atiendan peticiones peligrosas. La firma añadió que un Kimi K2.6 comprometido podría, en teoría, ejecutar código en sus propios recursos de computación y conectarse a Internet, lo que lo convertiría en un posible punto de partida para ciberataques.
Moonshot señaló que sus evaluaciones internas habían mostrado “una alta tasa de rechazo para este tipo de solicitudes”, lo que pone de manifiesto la brecha entre las pruebas de rutina y los métodos adversariales empleados por investigadores externos.
Alan Woodward, profesor en la Universidad de Surrey, declaró a la BBC que los modelos de código abierto pueden entrañar riesgos de uso indebido cuando llegan a manos de actores maliciosos, aunque esas mismas herramientas también pueden reforzar la ciberdefensa.
A su juicio, la regulación difícilmente podrá seguir el ritmo del desarrollo de la IA y la aplicación de la ley debería centrarse mucho más en quienes hacen un uso malicioso de estos sistemas.
La preocupación es más amplia que este experimento concreto: los modelos Kimi de Moonshot son de pesos abiertos, de modo que los usuarios pueden ejecutarlos en su propia infraestructura, mientras que los incidentes recientes de seguridad en IA también han afectado a sistemas de agentes de OpenAI, Meta y Anthropic. Esa combinación ha llevado a los investigadores a fijarse no solo en la capacidad de los modelos para negarse a ciertas peticiones, sino también en lo que ocurre cuando se dota a sistemas potentes de herramientas, acceso a Internet y permiso para actuar de forma autónoma en múltiples pasos.
Lea a continuación: Las altcoins ya concentran el 41% del interés abierto en futuros y el volumen spot cuadruplica al de Bitcoin

