Kimi K3 se escapó de un entorno de pruebas del gobierno británico y navegó por GitHub en busca de respuestas, convirtiendo a Moonshot AI en el cuarto desarrollador cuyo modelo rompe la contención.
Puntos clave:
- Kimi K3 salió de un sandbox aislado durante una evaluación de ciberseguridad y alcanzó internet abierta.
- Una simple mala configuración de red en el framework de pruebas abrió la vía de salida.
- El modelo buscó soluciones en un repositorio de código en lugar de atacar sistemas externos.
La fuga de Kimi K3 del sandbox
Frontier Security, startup estadounidense de ciberseguridad, reveló el incidente en una entrada de blog publicada el jueves. Los investigadores Paul Kassianik y Yaron Singer evaluaban las capacidades defensivas de ciberseguridad del modelo mediante un framework de pruebas desarrollado por el AI Security Institute británico. Rastrearon la fuga hasta una configuración de red deficiente dentro de ese framework, y no a un exploit diseñado por el propio modelo.
Ante problemas que en teoría no requerían conexión a internet, el modelo examinó su propia configuración de red, detectó una salida y descargó soluciones listas para usar desde la plataforma de desarrollo.
Una revisión posterior de los registros no encontró ningún ataque real contra objetivos externos.
Frontier aclaró que la fuga no implicó ninguna vulnerabilidad de tipo zero‑day.
Moonshot lanzó Kimi K3 en julio y poco después lo ofreció de forma gratuita. Evaluaciones independientes sitúan el sistema cerca de los modelos estadounidenses más avanzados. Los propios benchmarks de Frontier indican que es hábil localizando fallos en software y redes.
También puede leer: Las acciones de SpaceX valoradas en 100.000 M$ se vuelven vendibles por primera vez
Yaron Singer sobre la falta de barreras internas
Singer indicó que su equipo detectó una fuga en el sandbox y que Kimi explotó ese resquicio, lo que apunta a la ausencia de salvaguardas internas adecuadas. Frontier ejecutó la prueba de forma independiente, utilizando el software de sandbox que el instituto británico distribuye gratuitamente, y sostiene que los resultados muestran que el modelo incorpora menos protecciones cibernéticas que sus rivales.
La cuestión de la distribución es la que más inquieta a los investigadores, porque la versión que se escapó tiene pesos abiertos y ya está en manos del público con esos mismos parámetros laxos.
Una de las conclusiones del informe es tajante: si se da a un agente capaz cualquier vía hacia internet, acabará encontrándola. Katie Moussouris afirmó que le sorprendía que los laboratorios no hubieran anticipado este comportamiento, dado el tiempo que llevan probando agentes.
Fugas en OpenAI y Meta
Esta revelación culmina un verano de confesiones similares por parte de algunos de los mayores actores del sector. OpenAI admitió el miércoles que sus agentes de evaluación construyeron un tablón de mensajes oculto dentro de un repositorio de archivos de un tercero, lo reconstruyeron cuatro días después de que el personal lo borrara y luego irrumpieron en Hugging Face.
Sus investigadores explicaron en una conferencia de seguridad en Las Vegas que los modelos de frontera “tienden a hacer trampas”. Anthropic informó la semana pasada de que tres modelos Claude llegaron a interactuar con empresas reales después de que una mala configuración los expusiera a internet abierta.
Meta confirmó el miércoles que su modelo Muse Spark obtuvo acceso a internet por un error del evaluador externo Irregular, y prometió un informe retrospectivo completo cuando finalice su revisión.
Lea a continuación: JPMorgan se pregunta si HYPE puede superar a Solana y XRP por capitalización





