Moonshot investiga un jailbreak de Kimi que permite a 2 modelos de IA responder sobre armas biológicas

Alexey Bondarev
Alexey Bondarevhace 45 minutos
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI está revisando dos modelos Kimi después de que investigadores de Mindgard lograran sortear sus controles de seguridad y obtener instrucciones sobre armas biológicas y asesinatos.

Claves del caso:

  • Mindgard afirmó que Kimi K2.6 y K3 Swarm pueden forzarse más allá de sus salvaguardas mediante jailbreak.
  • Los investigadores no demostraron que las respuestas dañinas funcionen en la práctica.
  • Moonshot señaló que está analizando los resultados y debatiéndolos con Mindgard.

Resultados del jailbreak de Kimi

La BBC informó de que Mindgard descubrió en julio que Kimi K2.6 y K3 Swarm podían superar los límites impuestos por los desarrolladores a través de un jailbreak, un procedimiento que utiliza prompts estructurados para comprobar si un modelo ignora sus normas de seguridad. Según Mindgard, esos controles tendrían que haber bloqueado conversaciones sobre temas tan sensibles.

El fundador Peter Garraghan explicó a la BBC que, una vez que el jailbreak funcionaba, los modelos aceptaban hablar prácticamente de cualquier asunto y podían ofrecer sugerencias aún más peligrosas sin que se les solicitara de forma explícita.

Moonshot dijo a la BBC que valora las aportaciones de terceros “como un pilar clave para construir una IA mejor y más segura” y aseguró que está discutiendo los hallazgos con Mindgard. Mindgard indicó que envió un correo a Moonshot el 27 de julio, hizo un recordatorio alrededor de una semana después y publicó sus conclusiones el 12 de septiembre.

También te puede interesar: Ripple ayuda a la CSD BR de Brasil a reflejar la titularidad de fondos en una blockchain pública

Riesgos de seguridad señalados por Mindgard

Mindgard no ha verificado que las instrucciones generadas funcionen en el mundo real, pero sostiene que el mero hecho de que se hayan producido demuestra un fallo en las salvaguardas diseñadas para impedir que los sistemas atiendan peticiones peligrosas. La firma añadió que un Kimi K2.6 comprometido podría, en teoría, ejecutar código en sus propios recursos de cómputo y conectarse a internet, convirtiéndose en un posible vector de ciberataques.

Moonshot señaló que sus evaluaciones internas habían mostrado “una alta tasa de rechazo para este tipo de solicitudes”, lo que pone de relieve la brecha entre las pruebas rutinarias y los métodos adversariales empleados por investigadores externos.

Alan Woodward, profesor en la Universidad de Surrey, declaró a la BBC que los modelos de código abierto conllevan riesgos de uso indebido cuando llegan a manos de actores maliciosos, aunque las mismas herramientas también pueden reforzar la ciberdefensa.

A su juicio, la regulación difícilmente podrá seguir el ritmo del desarrollo de la IA y la supervisión debería centrarse más en perseguir a quienes hacen un uso malicioso de estos sistemas.

La preocupación de fondo va más allá de este experimento: los modelos Kimi de Moonshot son de pesos abiertos, por lo que los usuarios pueden ejecutarlos en su propia infraestructura, mientras que incidentes recientes de seguridad en IA también han afectado a sistemas de agentes de OpenAI, Meta y Anthropic. Esta combinación está llevando a los investigadores a fijarse no solo en las negativas del modelo a responder, sino también en lo que ocurre cuando se dota a sistemas potentes de herramientas, acceso a internet y capacidad para actuar en múltiples pasos.

Lee también: Las altcoins concentran el 41% del interés abierto en futuros y el volumen spot cuadruplica al de Bitcoin

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es el Jefe de Contenido en Yellow.com y ha cubierto el sector cripto durante los últimos 10 años. Está especializado en investigaciones y artículos educativos en profundidad, con un enfoque en el análisis, el contexto de la industria y las grandes fuerzas que están dando forma al cripto, desde la era de la IA y las tecnologías de seguridad hasta la innovación en fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja duro para ayudar a que eso se haga realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
Últimas noticias
Ver todas las noticias
Moonshot investiga un jailbreak de Kimi que permite a 2 modelos de IA responder sobre armas biológicas | Yellow