Anthropic asegura que Claude reduce fallos de alineamiento en pruebas automatizadas

Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)
Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)

Puntos clave

Anthropic publica investigación sobre Claude realizando trabajo automatizado de alineamiento. Claude mejora las puntuaciones de seguridad en 10 tipos de fallos de alineamiento analizados. Anthropic sostiene que las capacidades generales del modelo se mantuvieron durante las pruebas. La empresa libera su entorno automatizado de investigación en alineamiento para terceros.

Anthropic afirma que Claude elevó las puntuaciones de seguridad en 10 fallos de alineamiento probados mediante un proceso de investigación automatizado. Según la compañía, las pruebas preservaron las capacidades generales del modelo mientras los investigadores analizaban distintas intervenciones de seguridad.

Anthropic explicó en una publicación que ha puesto a disposición de investigadores externos su entorno automatizado de investigación en alineamiento. La firma presenta este trabajo como un intento de medir y mitigar el desalineamiento de los modelos.

Claude pone a prueba intervenciones de seguridad

Anthropic detalla que Claude examinó formas habituales de desalineamiento, incluidas la deshonestidad y la adulación servil. El modelo propuso métodos, entrenó modelos más pequeños y evaluó los resultados sin intervención directa paso a paso.

La compañía señala que en un experimento inicial Claude dispuso de 48 horas y de una unidad de procesamiento gráfico. En ese periodo investigó enfoques, propuso estrategias de entrenamiento y probó los modelos resultantes.

Según Anthropic, Claude logró mejorar las métricas de seguridad sin degradar las capacidades generales en los entornos analizados. También indicó que algunos métodos se trasladaron con éxito a “benchmarks” que no formaban parte del proceso de optimización.

La empresa informó de que sus métodos se generalizaron al “Petri behavioral audit”. Anthropic añadió que las pruebas incluyeron modelos hasta 4,7 veces más grandes que los utilizados en la fase principal de investigación.

Estos resultados se circunscriben a entornos de prueba medidos. Anthropic advierte de que fallos sutiles o poco frecuentes pueden no aflorar en los “benchmarks” disponibles.

También lea: Actualización de TRON añade verificación P-256 y mayor historial de bloques

La alineación de la IA se automatiza

Antes de esta publicación, el trabajo de alineamiento dependía sobre todo de investigadores humanos que diseñaban intervenciones y evaluaban los modelos. Si sus resultados resisten evaluaciones independientes, los sistemas automatizados podrían acortar de forma notable ese ciclo.

En los últimos 30 días, los debates sobre seguridad en IA se han centrado cada vez más en si modelos más potentes pueden ayudar a evaluar y mejorar sistemas más débiles.

Ese enfoque descansa en mediciones fiables y en salvaguardas frente a resultados engañosos en “benchmarks”. Anthropic indica que su experimento empleó pruebas reservadas (“held-out tests”) para comprobar si los métodos se generalizaban más allá de los “benchmarks” que Claude optimizó. La compañía no sostiene que los resultados en estas métricas eliminen todos los riesgos asociados a los modelos.

La firma subraya que la elección de las métricas adecuadas sigue siendo un elemento central de este tipo de trabajos.

Un entorno disponible para la comunidad investigadora

Anthropic ha liberado este entorno de investigación para que otros grupos puedan reproducir o ampliar los experimentos. Serán las pruebas externas las que determinen si los métodos funcionan con distintos modelos y marcos de evaluación de seguridad.

La compañía no presenta estos hallazgos como sustituto de evaluaciones más amplias de los modelos. El resultado comunicado se limita a los fallos de alineamiento considerados y a las restricciones experimentales aplicadas.

Es previsible que la comunidad investigadora centre sus esfuerzos en la replicación, el diseño de “benchmarks” y el análisis de posibles modos de fallo. La publicación de Anthropic aporta una estructura de referencia para este tipo de estudios.

Lea a continuación: El copy trading por FOMO dejó casi al 94% de las carteras en pérdidas: estudio

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza es un periodista financiero experimentado con amplia trayectoria cubriendo criptomonedas y tecnología blockchain. Ha contribuido a Benzinga y Cointelegraph, entre otras publicaciones, informando sobre tendencias emergentes, el panorama regulatorio y más. Encuéntralo en @murtuza_merc en Twitter y como mmerchant001 en Telegram. Divulgación: Murtuza posee ATOM, AKT, TIA, INJ y OSMO.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.