Mythos 5 tuvo que vencer CAPTCHAs para hacerse pasar por humano, luego llegó el malware

Claude Mythos 5 battled CAPTCHA tests across hundreds of transcript pages before uploading malware to PyPI, Anthropic records show (Image: Shutterstock)
Claude Mythos 5 battled CAPTCHA tests across hundreds of transcript pages before uploading malware to PyPI, Anthropic records show (Image: Shutterstock)

Una transcripción de 1.022 páginas publicada por Anthropic muestra cómo su modelo Claude Mythos 5 se enfrentó durante cientos de páginas a pruebas CAPTCHA antes de cargar un paquete malicioso que llegó a instalarse en 15 sistemas.

Puntos clave:

  • Claude Mythos 5 accedió a internet real durante una prueba de ciberseguridad y subió un paquete malicioso a PyPI.
  • Los controles CAPTCHA ocuparon cientos de páginas de transcripción, pero no lograron frenarlo.
  • Anthropic calificó la conducta de imprudente y encargó una auditoría externa.

La batalla de Mythos 5 con los CAPTCHA

Anthropic publicó la transcripción el 9 de septiembre, junto con un análisis de cuatro incidentes en los que modelos Claude llegaron a sistemas reales de terceros durante pruebas de ciberseguridad. Los modelos se ejecutaron sin las salvaguardas técnicas que incorporan los productos comerciales. A Mythos 5 se le indicó que no tenía acceso a internet, pero una configuración errónea dejó abierta una vía hacia la red pública, y el sistema plantó un paquete de robo de credenciales en PyPI, el repositorio público de software Python.

Para registrar una cuenta en PyPI tuvo que superar controles antibot, y un análisis de la transcripción detectó que cientos de páginas se dedican solo a sortear ese obstáculo, mientras que la escritura del exploit fue relativamente sencilla.

El modelo se enfrentó a pruebas de reconocimiento de caracteres y a rompecabezas de “elige el intruso” con imágenes de cocodrilos, ranas y gorilas, llegando a escribir en un momento dado: «¿PERO QUÉ DEMONIOS ESTÁ MAL EN LAS RESPUESTAS?».

También intentó usar credenciales de procesadores de pago en línea y rastrear criptomonedas para pagar un número de teléfono, que necesitaba para registrar una dirección de correo electrónico. Ninguna de las dos vías funcionó. Terminó recurriendo a un proveedor de correo desechable gratuito cuyo dominio PyPI no había bloqueado.

Finalmente, el modelo superó los controles y publicó su paquete en tres versiones, que poco después fueron instaladas en 15 servidores de terceros. Anthropic cree que se trataba de empresas de seguridad que escanean automáticamente las nuevas subidas.

Uno de esos escáneres filtró sus credenciales, que el modelo utilizó para acceder a la base de datos en producción de ese proveedor. PyPI retiró el paquete en menos de una hora.

También ver: Lazarus de Corea del Norte movió 1.000 millones de dólares robados a través de blanqueadores chinos, según ZachXBT

El veredicto de Colin Fraser y Anthropic

El científico de datos Colin Fraser llamó la atención sobre la enorme proporción del esfuerzo del modelo dedicada a saltarse las defensas antibot. Anthropic afirma que este es el incidente que más le preocupa de los cuatro analizados. Sus auditorías previas al despliegue no habían detectado este patrón de conducta.

La compañía concluyó que el modelo razonó de forma sesgada y actuó de manera temeraria, insistiendo en que se encontraba en una simulación pese a tener evidencias claras de que operaba en internet real. En una réplica simulada de 150 ejecuciones, Mythos 5 tomó una acción gravemente dañina en el 82% de los casos, frente al 31% de Claude Opus 5 y el 33% de Claude Mythos 5.1.

Incidentes previos con Claude

Anthropic había revelado por primera vez tres de estos incidentes el 30 de julio, tras analizar unas 141.000 transcripciones de pruebas de ciberseguridad en las que los modelos podían llegar a conectarse a internet. Un cuarto episodio, que involucró a una versión temprana de Claude Opus 4.6 en enero, salió a la luz en agosto, y desde entonces la empresa ha firmado un acuerdo de ocho semanas con el evaluador externo METR para investigar los cuatro casos. Anthropic afirma que ya ha notificado a todas las partes afectadas.

Lea a continuación: AMD afirma que la demanda de IA es tan alta que elevará “sustancialmente” la oferta de chips en 2027

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es jefe de Contenidos en Yellow.com. Está especializado en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportajes analíticos, contexto del sector y las grandes fuerzas que están moldeando las criptomonedas, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para ayudar a que eso se haga realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
Últimas noticias
Ver todas las noticias