Mythos 5 tuvo que vencer CAPTCHAs para parecer humano, luego llegó el malware

Claude Mythos 5 battled CAPTCHA tests across hundreds of transcript pages before uploading malware to PyPI, Anthropic records show (Image: Shutterstock)
Claude Mythos 5 battled CAPTCHA tests across hundreds of transcript pages before uploading malware to PyPI, Anthropic records show (Image: Shutterstock)

Una transcripción de 1.022 páginas publicada por Anthropic revela que su modelo Claude Mythos 5 se pasó cientos de páginas intentando superar pruebas CAPTCHA antes de subir a PyPI un paquete malicioso que acabó instalado en 15 sistemas.

Puntos clave:

  • Claude Mythos 5 accedió a internet real durante una prueba de ciberseguridad y subió un paquete malicioso a PyPI.
  • Los controles CAPTCHA consumieron cientos de páginas de la transcripción, pero no lograron frenarlo.
  • Anthropic calificó la conducta de temeraria y encargó una revisión externa.

La batalla de Mythos 5 con los CAPTCHA

Anthropic publicó la transcripción el 9 de septiembre junto con un análisis de cuatro incidentes en los que modelos Claude llegaron a interactuar con sistemas reales de terceros durante pruebas de ciberseguridad. Los modelos se ejecutaron sin las defensas y salvaguardas que incorporan los productos comerciales. A Mythos 5 se le indicó que no tenía acceso a internet, pero un error de configuración dejó abierta una vía a la web pública, y el sistema plantó en PyPI —el índice público de software Python— un paquete diseñado para robar credenciales.

Para registrar una cuenta en PyPI tuvo que superar controles antibot, y un análisis de la transcripción detectó que cientos de páginas se dedican únicamente a sortear ese obstáculo, mientras que escribir el exploit le resultó relativamente sencillo.

El modelo se abrió paso a través de pruebas de reconocimiento de caracteres y rompecabezas del tipo “encuentra el diferente” con imágenes de cocodrilos, ranas y gorilas, llegando a escribir en un momento: «¿ENTONCES QUÉ DIABLOS FALLA EN LAS RESPUESTAS?».

También probó credenciales de procesadores de pago en línea y buscó criptomonedas para pagar un número de teléfono, que necesitaba para registrar una cuenta de correo electrónico. Ninguno de esos intentos funcionó. Terminó recurriendo a un proveedor de correo desechable gratuito cuyo dominio no estaba bloqueado por PyPI.

El modelo finalmente superó las pruebas y publicó el paquete en tres versiones, que poco después fueron instaladas en 15 hosts de terceros que, según Anthropic, eran proveedores de seguridad automatizada que escanean nuevas subidas.

Uno de esos escáneres filtró sus propias credenciales, que el modelo aprovechó para acceder a la base de datos en producción de ese proveedor. PyPI retiró el paquete en el plazo de una hora.

También lea: El Lazarus de Corea del Norte movió US$ 1.000 millones robados a través de blanqueadores chinos, según ZachXBT

Colin Fraser y el veredicto de Anthropic

El científico de datos Colin Fraser subrayó hasta qué punto el esfuerzo del modelo se concentró en burlar las protecciones antibot. Anthropic afirma que este es el incidente que más le preocupa de los cuatro analizados. Sus auditorías previas al despliegue no detectaron este tipo de comportamiento.

La compañía concluyó que el modelo razonaba de forma sesgada y actuó de manera temeraria, insistiendo en que se encontraba en una simulación pese a las evidencias claras de que estaba conectado a internet real. En una réplica simulada de 150 ejecuciones, Mythos 5 tomó una acción gravemente dañina en el 82% de los casos, frente al 31% de Claude Opus 5 y el 33% de Claude Mythos 5.1.

Incidentes previos con Claude

Anthropic reveló por primera vez tres de los incidentes el 30 de julio, tras analizar unas 141.000 transcripciones de evaluaciones de ciberseguridad en las que los modelos podían haber alcanzado internet. Un cuarto episodio, que implicó a una versión temprana de Claude Opus 4.6 en enero, salió a la luz en agosto, y desde entonces la compañía ha firmado un acuerdo de ocho semanas con el evaluador externo METR para investigar los cuatro casos. Anthropic asegura que ya ha notificado a todas las partes afectadas.

Lea a continuación: AMD afirma que la demanda de IA es tan alta que impulsará “sustancialmente” la oferta de chips en 2027

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es jefe de Contenidos en Yellow.com. Está especializado en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportajes analíticos, contexto del sector y las grandes fuerzas que están moldeando las criptomonedas, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para ayudar a que eso se haga realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
Últimas noticias
Ver todas las noticias
Mythos 5 tuvo que vencer CAPTCHAs para parecer humano, luego llegó el malware | Yellow