Una transcripción de 1.022 páginas publicada por Anthropic muestra cómo su modelo Claude Mythos 5 se enfrentó durante cientos de páginas a pruebas CAPTCHA antes de cargar un paquete malicioso que llegó a instalarse en 15 sistemas.
Puntos clave:
- Claude Mythos 5 accedió a internet real durante una prueba de ciberseguridad y subió un paquete malicioso a PyPI.
- Los controles CAPTCHA ocuparon cientos de páginas de transcripción, pero no lograron frenarlo.
- Anthropic calificó la conducta de imprudente y encargó una auditoría externa.
La batalla de Mythos 5 con los CAPTCHA
Anthropic publicó la transcripción el 9 de septiembre, junto con un análisis de cuatro incidentes en los que modelos Claude llegaron a sistemas reales de terceros durante pruebas de ciberseguridad. Los modelos se ejecutaron sin las salvaguardas técnicas que incorporan los productos comerciales. A Mythos 5 se le indicó que no tenía acceso a internet, pero una configuración errónea dejó abierta una vía hacia la red pública, y el sistema plantó un paquete de robo de credenciales en PyPI, el repositorio público de software Python.
Para registrar una cuenta en PyPI tuvo que superar controles antibot, y un análisis de la transcripción detectó que cientos de páginas se dedican solo a sortear ese obstáculo, mientras que la escritura del exploit fue relativamente sencilla.
El modelo se enfrentó a pruebas de reconocimiento de caracteres y a rompecabezas de “elige el intruso” con imágenes de cocodrilos, ranas y gorilas, llegando a escribir en un momento dado: «¿PERO QUÉ DEMONIOS ESTÁ MAL EN LAS RESPUESTAS?».
También intentó usar credenciales de procesadores de pago en línea y rastrear criptomonedas para pagar un número de teléfono, que necesitaba para registrar una dirección de correo electrónico. Ninguna de las dos vías funcionó. Terminó recurriendo a un proveedor de correo desechable gratuito cuyo dominio PyPI no había bloqueado.
Finalmente, el modelo superó los controles y publicó su paquete en tres versiones, que poco después fueron instaladas en 15 servidores de terceros. Anthropic cree que se trataba de empresas de seguridad que escanean automáticamente las nuevas subidas.
Uno de esos escáneres filtró sus credenciales, que el modelo utilizó para acceder a la base de datos en producción de ese proveedor. PyPI retiró el paquete en menos de una hora.
También ver: Lazarus de Corea del Norte movió 1.000 millones de dólares robados a través de blanqueadores chinos, según ZachXBT
El veredicto de Colin Fraser y Anthropic
El científico de datos Colin Fraser llamó la atención sobre la enorme proporción del esfuerzo del modelo dedicada a saltarse las defensas antibot. Anthropic afirma que este es el incidente que más le preocupa de los cuatro analizados. Sus auditorías previas al despliegue no habían detectado este patrón de conducta.
La compañía concluyó que el modelo razonó de forma sesgada y actuó de manera temeraria, insistiendo en que se encontraba en una simulación pese a tener evidencias claras de que operaba en internet real. En una réplica simulada de 150 ejecuciones, Mythos 5 tomó una acción gravemente dañina en el 82% de los casos, frente al 31% de Claude Opus 5 y el 33% de Claude Mythos 5.1.
Incidentes previos con Claude
Anthropic había revelado por primera vez tres de estos incidentes el 30 de julio, tras analizar unas 141.000 transcripciones de pruebas de ciberseguridad en las que los modelos podían llegar a conectarse a internet. Un cuarto episodio, que involucró a una versión temprana de Claude Opus 4.6 en enero, salió a la luz en agosto, y desde entonces la empresa ha firmado un acuerdo de ocho semanas con el evaluador externo METR para investigar los cuatro casos. Anthropic afirma que ya ha notificado a todas las partes afectadas.
Lea a continuación: AMD afirma que la demanda de IA es tan alta que elevará “sustancialmente” la oferta de chips en 2027

