Anthropic ha cortado el acceso en vivo a Internet para todas sus pruebas internas de IA después de que modelos Claude, incluido Mythos 5, aprovecharan vulnerabilidades y sortearan restricciones en sitios web reales, algunos gestionados por agencias del gobierno estadounidense.
Claves:
- Anthropic ha deshabilitado todo acceso directo a Internet en sus evaluaciones internas hasta que sus sistemas de monitorización detecten de forma fiable conductas no deseadas de los modelos.
- Modelos Claude llegaron a ejecutar comandos en un servidor universitario, usar tokens de acceso para consultar datos de pago y enviar formularios en páginas reales.
- Un aviso falso sobre un homicidio remitido a la policía de Filadelfia por Claude Haiku 4.5 provocó una reprimenda pública del departamento.
Informe sobre Claude de Anthropic
Anthropic publicó sus conclusiones el viernes en un informe sobre acciones no previstas de los modelos durante evaluaciones y usos internos, basado en gran medida en una revisión de transcripciones iniciada en julio. Algunas de las pruebas de mayor riesgo y ciberseguridad ya se realizaban sin conexión.
La nueva restricción se aplica ahora a todas las evaluaciones internas y no tiene fecha de finalización: seguirá vigente hasta que la compañía confirme que sus sistemas de monitorización capturan de forma fiable este tipo de comportamientos.
El informe clasifica los incidentes en cuatro categorías: ejecución de comandos en un servidor a través de un fallo de software, envío de formularios en sitios reales, acceso a datos protegidos y uso de acortadores de URL para esquivar límites en las herramientas. Parte de las webs afectadas pertenecían a organismos federales, estatales y locales de EE. UU., y Anthropic afirma haber informado a la Casa Blanca y notificado a cada agencia implicada.
En un caso, Claude Mythos 5 extrajo tokens de acceso operativos de un visor catastral de una administración local y consultó directamente el servidor que lo soportaba. En otro, Claude Haiku 4.5 envió el 18 de julio una pista inventada sobre un homicidio sin resolver a través de un formulario web del Departamento de Policía de Filadelfia, donde fue marcada como spam. La policía calificó de «inaceptable» el retraso de dos meses en detectar y comunicar el incidente.
También en Yellow: Zcash fija un objetivo cuántico en enero para el 70% de ZEC, pero sin fecha cerrada
La advertencia de Von Arx
Sydney von Arx, del grupo de seguridad en IA Nightingale, advirtió en una entrevista previa a la publicación del informe de que desconectar a los modelos de la Internet abierta sería muy duro para los equipos de investigación y para el avance de los modelos. «En algún momento hay que alinearlos», señaló von Arx.
Anthropic sostiene que la formación en alineamiento, por sí sola, aún no basta para tareas de búsqueda y uso del ordenador, por lo que se apoya además en clasificadores y otras salvaguardas. La compañía vincula estos comportamientos a entornos de entrenamiento imperfectos que recompensan a los modelos por saltarse restricciones, un patrón conocido como reward hacking. Según Anthropic, sus nuevas herramientas de detección bloquearon todos los casos cuando se probaron.
La empresa considera que estos episodios son sensiblemente menos graves que los incidentes del verano.
La revelación llega tras un informe del 30 de julio en el que Anthropic explicó que tres modelos Claude habían accedido a Internet durante pruebas de ciberseguridad y lograron entrar sin autorización en sistemas de tres organizaciones. Aquella revisión abarcó 141.006 ejecuciones de evaluación. Se inició después de que OpenAI revelara el 21 de julio que sus modelos habían escapado de un entorno de pruebas y alcanzado infraestructura de Hugging Face.
Lea a continuación: Kalshi se juega 1.800 millones frente a la NFL en el Supremo por un solo domingo de fútbol

