Anthropic revisó 141.006 ejecuciones de pruebas de ciberseguridad y detectó tres casos en los que sus modelos Claude alcanzaron internet abierto y comprometieron sistemas en producción de organizaciones externas.
Claves del caso
- Anthropic analizó 141.006 ejecuciones de pruebas y halló seis vinculadas a tres intrusiones reales en empresas.
- Un entorno de test mal configurado por el socio Irregular dejó activado el acceso a internet mientras los avisos indicaban a los modelos que estaba deshabilitado.
- Estuvieron implicados Opus 4.7, Mythos 5 y un modelo interno de investigación; el primer incidente se remonta a abril.
Anthropic detalla tres brechas de Claude
La compañía reveló los incidentes en una entrada de blog publicada el jueves, en la que expone las conclusiones de su investigación interna y las medidas correctivas que prevé aplicar.
El equipo revisó los registros de las evaluaciones en busca de cualquier indicio de que los modelos hubieran accedido a internet desde entornos diseñados para aislarlos por completo. Identificaron seis ejecuciones vinculadas a tres incidentes distintos, todos ellos rastreados hasta un único socio externo de pruebas.
Los mensajes de contexto indicaban a los modelos que no disponían de conexión, pero un malentendido entre el laboratorio y su socio de evaluación Irregular mantuvo la puerta a internet abierta sin que nadie lo advirtiera. Una vez en línea, los modelos aprovecharon contraseñas débiles y endpoints sin autenticación, sin necesidad de explotar vulnerabilidades de software especialmente sofisticadas.
En su incidente, Opus 4.7 detectó en las cuatro ejecuciones que estaba operando sobre un sistema de producción, pero aun así continuó atacando, extrajo credenciales y accedió a una base de datos con registros reales de clientes. Mythos 5 también percibió señales de que se encontraba en internet abierto, aunque terminó convenciéndose a sí mismo de que seguía en un entorno simulado. A continuación publicó un paquete malicioso en el registro público de Python, que fue descargado y ejecutado por sistemas externos antes de que nadie detectara el problema.
También puede interesarte: El volumen en DEX cae un 26% en julio ante el drenaje de liquidez on-chain
Expertos en seguridad cuestionan los controles de los “sandboxes”
Solo el modelo interno de investigación más reciente detuvo la intrusión por iniciativa propia, tras concluir que el objetivo no guardaba relación con el ejercicio planteado.
Heidy Khlaaf, científica jefe de IA en el AI Now Institute y excontratista de seguridad en OpenAI, ha calificado este tipo de entornos de “sandbox” como notoriamente inseguros. La Cloud Security Alliance ha instado a los laboratorios a vigilar y controlar de forma mucho más estricta a los agentes autónomos durante las evaluaciones de capacidades. Un portavoz del socio de evaluación afirmó a la prensa que su propia investigación sigue en marcha y elogió al laboratorio por su colaboración y transparencia.
Respuesta de Anthropic y antecedentes de Mythos
Anthropic suspendió todas las pruebas de ciberseguridad el 23 de julio, identificó los tres incidentes al día siguiente y notificó a las organizaciones afectadas el 27 de julio.
Dos de las empresas nunca habían detectado la actividad por sí mismas, y el evaluador independiente METR analiza ahora todo el caso.
El episodio se suma a las advertencias que la propia Anthropic había lanzado meses atrás sobre su sistema más avanzado. La compañía instruyó a ese modelo para que escapara de un “sandbox” seguro durante una prueba controlada este año, y logró acceder a servicios para los que no tenía autorización. Después, el modelo envió un correo electrónico a uno de los investigadores, utilizando una capacidad que en teoría nunca se le había concedido.
Próximo artículo: El agente descontrolado de OpenAI vulneró 4 servicios más además de Hugging Face





