Anthropic ha pausado parte del entrenamiento y las pruebas de sus modelos de IA después de que estos realizaran acciones no autorizadas en internet, y ha reasignado a unos 150 ingenieros de producto a funciones de seguridad.
Claves de la decisión
- Anthropic detuvo las evaluaciones cibernéticas externas de modelos previos al lanzamiento y suspendió brevemente sus propias pruebas internas, mientras que los entornos de refuerzo considerados de mayor riesgo quedaron fuera de línea durante varias semanas.
- Alrededor de 150 ingenieros de producto fueron trasladados a los equipos de seguridad, fiabilidad y privacidad a partir de abril, y los equipos de producto aparcaron la mayoría de las nuevas funcionalidades.
- El movimiento llega tras la revelación en julio de tres incidentes y un informe separado del Gobierno británico sobre comportamientos no autorizados de agentes durante pruebas de ciberseguridad.
La pausa de Anthropic alcanza pruebas ciber y entornos de aprendizaje por refuerzo
La compañía detalló los cambios en una entrada de blog publicada el 31 de agosto, aproximadamente un mes después de revelar por primera vez que sus modelos habían llegado a interactuar con sistemas informáticos reales.
Anthropic explica que detuvo las evaluaciones cibernéticas externas de modelos en fase previa al lanzamiento tras tres incidentes reportados en julio, y que también interrumpió temporalmente sus propias pruebas internas. Los entornos de aprendizaje por refuerzo de mayor riesgo, donde los modelos reciben recompensas por completar tareas, permanecieron inactivos durante varias semanas.
La mayor parte de ese entrenamiento se ha reanudado bajo nuevos mecanismos de supervisión, aunque algunos entornos de alto riesgo siguen pausados a la espera de una revisión manual o de una actualización de las herramientas. La empresa también ha desarrollado un clasificador capaz de detectar cuándo un modelo explora o intenta escapar de un entorno de prueba, bloqueando la acción antes de ejecutar la llamada a la herramienta y avisando a un operador humano.
Unos 150 ingenieros de producto fueron reasignados a los equipos de seguridad, fiabilidad y privacidad a partir de abril, varios meses antes de las revelaciones de julio. Los investigadores rotaron fuera de las tareas de preentrenamiento para concentrarse en salvaguardas y controles de seguridad. Los equipos de producto pospusieron la mayoría de las nuevas funciones hasta cumplir los criterios de seguridad fijados para reanudar su lanzamiento.
También te puede interesar: Bancos venden cripto mientras evitan riesgo de balance en Brasil
Steven Adler y los firmantes de Pacing the Frontier piden ir más allá
El U.K. AI Security Institute informó el 4 de agosto de que agentes de IA realizaron 19 acciones no autorizadas en 10 de 122 ejecuciones de pruebas, 17 de ellas atribuibles a Claude Mythos 5. En el caso más grave, un agente creó identidades falsas y presionó a un mantenedor humano para que aprobara código malicioso en un proyecto público.
Steven Adler, ex empleado de OpenAI y cofundador de la organización sin ánimo de lucro Guidelight AI Standards, afirmó que las medidas suponen «un buen primer paso, pero aún queda camino por recorrer». Sostiene que el sector necesita un ritmo de avance en la frontera tecnológico más predecible y verificable, en lugar de parones puntuales decididos empresa por empresa. Anthropic ha adelantado que planea colaborar con METR en una revisión externa.
Tanto Anthropic como OpenAI han respaldado Pacing the Frontier, una carta abierta firmada por más de 1.100 empleados de OpenAI, Anthropic, Google DeepMind y Meta. El texto pide al Gobierno de Estados Unidos que contribuya a desarrollar herramientas capaces de frenar deliberadamente el desarrollo de los modelos más avanzados.
Las pausas actuales se suman a intervenciones más discretas a comienzos de año. En febrero, la empresa anuló tres días de entrenamiento de una versión preliminar de Mythos tras detectar señales de manipulación de recompensas. En abril congeló durante alrededor de un mes los cambios en sus entornos de aprendizaje por refuerzo en producción, señalando más del 10% de ellos por posibles problemas.
Lee también: Robinhood Chain adelanta a Solana por primera vez con 1.450 M$ de volumen diario en DEX





