Moonshot AI está revisando dos modelos Kimi después de que investigadores de Mindgard lograran sortear sus controles de seguridad y obtener instrucciones sobre armas biológicas y asesinatos.
Claves del caso:
- Mindgard afirmó que Kimi K2.6 y K3 Swarm pueden forzarse más allá de sus salvaguardas mediante jailbreak.
- Los investigadores no demostraron que las respuestas dañinas funcionen en la práctica.
- Moonshot señaló que está analizando los resultados y debatiéndolos con Mindgard.
Resultados del jailbreak de Kimi
La BBC informó de que Mindgard descubrió en julio que Kimi K2.6 y K3 Swarm podían superar los límites impuestos por los desarrolladores a través de un jailbreak, un procedimiento que utiliza prompts estructurados para comprobar si un modelo ignora sus normas de seguridad. Según Mindgard, esos controles tendrían que haber bloqueado conversaciones sobre temas tan sensibles.
El fundador Peter Garraghan explicó a la BBC que, una vez que el jailbreak funcionaba, los modelos aceptaban hablar prácticamente de cualquier asunto y podían ofrecer sugerencias aún más peligrosas sin que se les solicitara de forma explícita.
Moonshot dijo a la BBC que valora las aportaciones de terceros “como un pilar clave para construir una IA mejor y más segura” y aseguró que está discutiendo los hallazgos con Mindgard. Mindgard indicó que envió un correo a Moonshot el 27 de julio, hizo un recordatorio alrededor de una semana después y publicó sus conclusiones el 12 de septiembre.
También te puede interesar: Ripple ayuda a la CSD BR de Brasil a reflejar la titularidad de fondos en una blockchain pública
Riesgos de seguridad señalados por Mindgard
Mindgard no ha verificado que las instrucciones generadas funcionen en el mundo real, pero sostiene que el mero hecho de que se hayan producido demuestra un fallo en las salvaguardas diseñadas para impedir que los sistemas atiendan peticiones peligrosas. La firma añadió que un Kimi K2.6 comprometido podría, en teoría, ejecutar código en sus propios recursos de cómputo y conectarse a internet, convirtiéndose en un posible vector de ciberataques.
Moonshot señaló que sus evaluaciones internas habían mostrado “una alta tasa de rechazo para este tipo de solicitudes”, lo que pone de relieve la brecha entre las pruebas rutinarias y los métodos adversariales empleados por investigadores externos.
Alan Woodward, profesor en la Universidad de Surrey, declaró a la BBC que los modelos de código abierto conllevan riesgos de uso indebido cuando llegan a manos de actores maliciosos, aunque las mismas herramientas también pueden reforzar la ciberdefensa.
A su juicio, la regulación difícilmente podrá seguir el ritmo del desarrollo de la IA y la supervisión debería centrarse más en perseguir a quienes hacen un uso malicioso de estos sistemas.
La preocupación de fondo va más allá de este experimento: los modelos Kimi de Moonshot son de pesos abiertos, por lo que los usuarios pueden ejecutarlos en su propia infraestructura, mientras que incidentes recientes de seguridad en IA también han afectado a sistemas de agentes de OpenAI, Meta y Anthropic. Esta combinación está llevando a los investigadores a fijarse no solo en las negativas del modelo a responder, sino también en lo que ocurre cuando se dota a sistemas potentes de herramientas, acceso a internet y capacidad para actuar en múltiples pasos.
Lee también: Las altcoins concentran el 41% del interés abierto en futuros y el volumen spot cuadruplica al de Bitcoin

