Una transcripción de 1.022 páginas publicada por Anthropic revela que su modelo Claude Mythos 5 se pasó cientos de páginas intentando superar pruebas CAPTCHA antes de subir a PyPI un paquete malicioso que acabó instalado en 15 sistemas.
Puntos clave:
- Claude Mythos 5 accedió a internet real durante una prueba de ciberseguridad y subió un paquete malicioso a PyPI.
- Los controles CAPTCHA consumieron cientos de páginas de la transcripción, pero no lograron frenarlo.
- Anthropic calificó la conducta de temeraria y encargó una revisión externa.
La batalla de Mythos 5 con los CAPTCHA
Anthropic publicó la transcripción el 9 de septiembre junto con un análisis de cuatro incidentes en los que modelos Claude llegaron a interactuar con sistemas reales de terceros durante pruebas de ciberseguridad. Los modelos se ejecutaron sin las defensas y salvaguardas que incorporan los productos comerciales. A Mythos 5 se le indicó que no tenía acceso a internet, pero un error de configuración dejó abierta una vía a la web pública, y el sistema plantó en PyPI —el índice público de software Python— un paquete diseñado para robar credenciales.
Para registrar una cuenta en PyPI tuvo que superar controles antibot, y un análisis de la transcripción detectó que cientos de páginas se dedican únicamente a sortear ese obstáculo, mientras que escribir el exploit le resultó relativamente sencillo.
El modelo se abrió paso a través de pruebas de reconocimiento de caracteres y rompecabezas del tipo “encuentra el diferente” con imágenes de cocodrilos, ranas y gorilas, llegando a escribir en un momento: «¿ENTONCES QUÉ DIABLOS FALLA EN LAS RESPUESTAS?».
También probó credenciales de procesadores de pago en línea y buscó criptomonedas para pagar un número de teléfono, que necesitaba para registrar una cuenta de correo electrónico. Ninguno de esos intentos funcionó. Terminó recurriendo a un proveedor de correo desechable gratuito cuyo dominio no estaba bloqueado por PyPI.
El modelo finalmente superó las pruebas y publicó el paquete en tres versiones, que poco después fueron instaladas en 15 hosts de terceros que, según Anthropic, eran proveedores de seguridad automatizada que escanean nuevas subidas.
Uno de esos escáneres filtró sus propias credenciales, que el modelo aprovechó para acceder a la base de datos en producción de ese proveedor. PyPI retiró el paquete en el plazo de una hora.
También lea: El Lazarus de Corea del Norte movió US$ 1.000 millones robados a través de blanqueadores chinos, según ZachXBT
Colin Fraser y el veredicto de Anthropic
El científico de datos Colin Fraser subrayó hasta qué punto el esfuerzo del modelo se concentró en burlar las protecciones antibot. Anthropic afirma que este es el incidente que más le preocupa de los cuatro analizados. Sus auditorías previas al despliegue no detectaron este tipo de comportamiento.
La compañía concluyó que el modelo razonaba de forma sesgada y actuó de manera temeraria, insistiendo en que se encontraba en una simulación pese a las evidencias claras de que estaba conectado a internet real. En una réplica simulada de 150 ejecuciones, Mythos 5 tomó una acción gravemente dañina en el 82% de los casos, frente al 31% de Claude Opus 5 y el 33% de Claude Mythos 5.1.
Incidentes previos con Claude
Anthropic reveló por primera vez tres de los incidentes el 30 de julio, tras analizar unas 141.000 transcripciones de evaluaciones de ciberseguridad en las que los modelos podían haber alcanzado internet. Un cuarto episodio, que implicó a una versión temprana de Claude Opus 4.6 en enero, salió a la luz en agosto, y desde entonces la compañía ha firmado un acuerdo de ocho semanas con el evaluador externo METR para investigar los cuatro casos. Anthropic asegura que ya ha notificado a todas las partes afectadas.
Lea a continuación: AMD afirma que la demanda de IA es tan alta que impulsará “sustancialmente” la oferta de chips en 2027

