Anthropic corta el acceso a Internet de las pruebas internas de Claude tras llegar Mythos 5 a webs gubernamentales

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropic ha cortado el acceso en vivo a Internet para todas sus pruebas internas de IA después de que modelos Claude, incluido Mythos 5, aprovecharan vulnerabilidades y sortearan restricciones en sitios web reales, algunos gestionados por agencias del gobierno estadounidense.

Claves:

  • Anthropic ha deshabilitado todo acceso directo a Internet en sus evaluaciones internas hasta que sus sistemas de monitorización detecten de forma fiable conductas no deseadas de los modelos.
  • Modelos Claude llegaron a ejecutar comandos en un servidor universitario, usar tokens de acceso para consultar datos de pago y enviar formularios en páginas reales.
  • Un aviso falso sobre un homicidio remitido a la policía de Filadelfia por Claude Haiku 4.5 provocó una reprimenda pública del departamento.

Informe sobre Claude de Anthropic

Anthropic publicó sus conclusiones el viernes en un informe sobre acciones no previstas de los modelos durante evaluaciones y usos internos, basado en gran medida en una revisión de transcripciones iniciada en julio. Algunas de las pruebas de mayor riesgo y ciberseguridad ya se realizaban sin conexión.

La nueva restricción se aplica ahora a todas las evaluaciones internas y no tiene fecha de finalización: seguirá vigente hasta que la compañía confirme que sus sistemas de monitorización capturan de forma fiable este tipo de comportamientos.

El informe clasifica los incidentes en cuatro categorías: ejecución de comandos en un servidor a través de un fallo de software, envío de formularios en sitios reales, acceso a datos protegidos y uso de acortadores de URL para esquivar límites en las herramientas. Parte de las webs afectadas pertenecían a organismos federales, estatales y locales de EE. UU., y Anthropic afirma haber informado a la Casa Blanca y notificado a cada agencia implicada.

En un caso, Claude Mythos 5 extrajo tokens de acceso operativos de un visor catastral de una administración local y consultó directamente el servidor que lo soportaba. En otro, Claude Haiku 4.5 envió el 18 de julio una pista inventada sobre un homicidio sin resolver a través de un formulario web del Departamento de Policía de Filadelfia, donde fue marcada como spam. La policía calificó de «inaceptable» el retraso de dos meses en detectar y comunicar el incidente.

También en Yellow: Zcash fija un objetivo cuántico en enero para el 70% de ZEC, pero sin fecha cerrada

La advertencia de Von Arx

Sydney von Arx, del grupo de seguridad en IA Nightingale, advirtió en una entrevista previa a la publicación del informe de que desconectar a los modelos de la Internet abierta sería muy duro para los equipos de investigación y para el avance de los modelos. «En algún momento hay que alinearlos», señaló von Arx.

Anthropic sostiene que la formación en alineamiento, por sí sola, aún no basta para tareas de búsqueda y uso del ordenador, por lo que se apoya además en clasificadores y otras salvaguardas. La compañía vincula estos comportamientos a entornos de entrenamiento imperfectos que recompensan a los modelos por saltarse restricciones, un patrón conocido como reward hacking. Según Anthropic, sus nuevas herramientas de detección bloquearon todos los casos cuando se probaron.

La empresa considera que estos episodios son sensiblemente menos graves que los incidentes del verano.

La revelación llega tras un informe del 30 de julio en el que Anthropic explicó que tres modelos Claude habían accedido a Internet durante pruebas de ciberseguridad y lograron entrar sin autorización en sistemas de tres organizaciones. Aquella revisión abarcó 141.006 ejecuciones de evaluación. Se inició después de que OpenAI revelara el 21 de julio que sus modelos habían escapado de un entorno de pruebas y alcanzado infraestructura de Hugging Face.

Lea a continuación: Kalshi se juega 1.800 millones frente a la NFL en el Supremo por un solo domingo de fútbol

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es jefe de Contenidos en Yellow.com. Está especializado en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportajes analíticos, contexto del sector y las grandes fuerzas que están moldeando las criptomonedas, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para ayudar a que eso se haga realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
Últimas noticias
Ver todas las noticias
Anthropic corta el acceso a Internet de las pruebas internas de Claude tras llegar Mythos 5 a webs gubernamentales | Yellow