Puntos clave
Anthropic publica investigación sobre Claude realizando trabajo automatizado de alineamiento. Claude mejora las puntuaciones de seguridad en 10 tipos de fallos de alineamiento analizados. Anthropic sostiene que las capacidades generales del modelo se mantuvieron durante las pruebas. La empresa libera su entorno automatizado de investigación en alineamiento para terceros.
Anthropic afirma que Claude elevó las puntuaciones de seguridad en 10 fallos de alineamiento probados mediante un proceso de investigación automatizado. Según la compañía, las pruebas preservaron las capacidades generales del modelo mientras los investigadores analizaban distintas intervenciones de seguridad.
Anthropic explicó en una publicación que ha puesto a disposición de investigadores externos su entorno automatizado de investigación en alineamiento. La firma presenta este trabajo como un intento de medir y mitigar el desalineamiento de los modelos.
Claude pone a prueba intervenciones de seguridad
Anthropic detalla que Claude examinó formas habituales de desalineamiento, incluidas la deshonestidad y la adulación servil. El modelo propuso métodos, entrenó modelos más pequeños y evaluó los resultados sin intervención directa paso a paso.
La compañía señala que en un experimento inicial Claude dispuso de 48 horas y de una unidad de procesamiento gráfico. En ese periodo investigó enfoques, propuso estrategias de entrenamiento y probó los modelos resultantes.
Según Anthropic, Claude logró mejorar las métricas de seguridad sin degradar las capacidades generales en los entornos analizados. También indicó que algunos métodos se trasladaron con éxito a “benchmarks” que no formaban parte del proceso de optimización.
La empresa informó de que sus métodos se generalizaron al “Petri behavioral audit”. Anthropic añadió que las pruebas incluyeron modelos hasta 4,7 veces más grandes que los utilizados en la fase principal de investigación.
Estos resultados se circunscriben a entornos de prueba medidos. Anthropic advierte de que fallos sutiles o poco frecuentes pueden no aflorar en los “benchmarks” disponibles.
También lea: Actualización de TRON añade verificación P-256 y mayor historial de bloques
La alineación de la IA se automatiza
Antes de esta publicación, el trabajo de alineamiento dependía sobre todo de investigadores humanos que diseñaban intervenciones y evaluaban los modelos. Si sus resultados resisten evaluaciones independientes, los sistemas automatizados podrían acortar de forma notable ese ciclo.
En los últimos 30 días, los debates sobre seguridad en IA se han centrado cada vez más en si modelos más potentes pueden ayudar a evaluar y mejorar sistemas más débiles.
Ese enfoque descansa en mediciones fiables y en salvaguardas frente a resultados engañosos en “benchmarks”. Anthropic indica que su experimento empleó pruebas reservadas (“held-out tests”) para comprobar si los métodos se generalizaban más allá de los “benchmarks” que Claude optimizó. La compañía no sostiene que los resultados en estas métricas eliminen todos los riesgos asociados a los modelos.
La firma subraya que la elección de las métricas adecuadas sigue siendo un elemento central de este tipo de trabajos.
Un entorno disponible para la comunidad investigadora
Anthropic ha liberado este entorno de investigación para que otros grupos puedan reproducir o ampliar los experimentos. Serán las pruebas externas las que determinen si los métodos funcionan con distintos modelos y marcos de evaluación de seguridad.
La compañía no presenta estos hallazgos como sustituto de evaluaciones más amplias de los modelos. El resultado comunicado se limita a los fallos de alineamiento considerados y a las restricciones experimentales aplicadas.
Es previsible que la comunidad investigadora centre sus esfuerzos en la replicación, el diseño de “benchmarks” y el análisis de posibles modos de fallo. La publicación de Anthropic aporta una estructura de referencia para este tipo de estudios.
Lea a continuación: El copy trading por FOMO dejó casi al 94% de las carteras en pérdidas: estudio

