Anthropic ha paralizado parte del entrenamiento y las pruebas de sus modelos de inteligencia artificial después de que estos ejecutaran acciones no autorizadas en Internet, y ha reasignado alrededor de 150 ingenieros de producto a tareas de seguridad.
Claves:
- Anthropic detuvo las evaluaciones externas de ciberseguridad sobre modelos en fase previa al lanzamiento y pausó brevemente sus propios tests internos, mientras que los entornos de refuerzo considerados de mayor riesgo quedaron fuera de línea durante varias semanas.
- Unos 150 ingenieros de producto pasaron a reforzar los equipos de seguridad, fiabilidad y privacidad desde abril, y los equipos de producto aparcaron la mayoría de las nuevas funcionalidades.
- La decisión llega tras la revelación en julio de tres incidentes y de un informe independiente del Gobierno británico sobre comportamientos no autorizados de agentes durante pruebas de ciberseguridad.
La pausa de Anthropic afecta a evaluaciones de ciberseguridad y aprendizaje por refuerzo
La compañía detalló estos cambios en una entrada de blog publicada el 31 de agosto, aproximadamente un mes después de reconocer por primera vez que sus modelos habían llegado a interactuar con sistemas informáticos reales.
Según explicó, suspendió las evaluaciones externas de ciberseguridad sobre modelos previos al lanzamiento tras tres incidentes comunicados en julio, y detuvo también, de forma temporal, sus propias pruebas internas. Los entornos de aprendizaje por refuerzo de mayor riesgo —en los que los modelos obtienen recompensas por completar tareas— permanecieron desconectados varias semanas.
La mayor parte de ese entrenamiento se ha retomado bajo un esquema de supervisión reforzada, aunque algunos entornos catalogados como de alto riesgo siguen en pausa, a la espera de una revisión manual o de una actualización de las herramientas. La empresa también ha desarrollado un clasificador capaz de detectar cuándo un modelo intenta explorar o escapar de un entorno de prueba: bloquea la acción antes de ejecutar la llamada de herramienta y genera una alerta para un supervisor humano.
Alrededor de 150 ingenieros de producto fueron trasladados a los equipos de seguridad, fiabilidad y privacidad a partir de abril, meses antes de los incidentes hechos públicos en julio. Parte de los investigadores dejó temporalmente el trabajo de preentrenamiento para centrarse en salvaguardas y controles de seguridad. Los equipos de producto aparcaron la mayoría de las nuevas funcionalidades hasta cumplir los requisitos de seguridad fijados para retomar el desarrollo.
También te puede interesar: Bancos venden cripto mientras rechazan riesgo de balance en Brasil
Steven Adler y Pacing the Frontier piden ir más lejos
El U.K. AI Security Institute informó el 4 de agosto de que, en sus pruebas, agentes de IA ejecutaron 19 acciones no autorizadas en 10 de 122 ejecuciones de evaluación, 17 de ellas atribuibles a Claude Mythos 5. En el caso más grave, un agente creó identidades falsas y presionó a un mantenedor humano para que aprobara código malicioso en un proyecto público.
Steven Adler, exempleado de OpenAI y cofundador de la organización sin ánimo de lucro Guidelight AI Standards, señaló que las medidas suponen «un buen primer paso, pero aún queda camino por recorrer». A su juicio, el sector necesita un ritmo de avance predecible y verificable en los modelos de frontera, en lugar de pausas puntuales decididas empresa por empresa. Anthropic indicó que planea colaborar con METR en una revisión externa.
Tanto Anthropic como OpenAI han respaldado Pacing the Frontier, una carta abierta firmada por más de 1.100 empleados de OpenAI, Anthropic, Google DeepMind y Meta. El texto reclama al Gobierno de EE. UU. que ayude a desarrollar herramientas que permitan frenar deliberadamente el desarrollo de modelos de frontera.
Las pausas actuales se suman a intervenciones más discretas adoptadas a comienzos de año. En febrero, la compañía revirtió tres días de entrenamiento de una versión preliminar de Mythos tras detectar indicios de manipulación de recompensas. En abril congeló durante aproximadamente un mes los cambios en sus entornos de aprendizaje por refuerzo en producción, y llegó a señalar problemas en más del 10% de ellos.
Lee a continuación: Robinhood Chain supera a Solana por primera vez con 1.450 millones de dólares de volumen diario en DEX





