Claude Cowork burló su sandbox y puso en riesgo a 500.000 Macs

Hidden Claude watermarks spark debate over traceable AI-assisted writing and file provenance (Image: Shutterstock)
Hidden Claude watermarks spark debate over traceable AI-assisted writing and file provenance (Image: Shutterstock)

Investigadores demostraron que Claude Cowork, de Anthropic, podía escapar de su máquina virtual local y acceder a archivos en todo un Mac, exponiendo potencialmente a unos 500.000 usuarios que ejecutaron sesiones locales.

Puntos clave:

  • Investigadores de seguridad lograron salir de la máquina virtual Linux de Claude Cowork y leer archivos en el Mac anfitrión.
  • La cadena combinó un fallo en el kernel de Linux con un montaje en modo escritura de todo el sistema de archivos del Mac.
  • Anthropic cerró el reporte como “informativo” y no aplicó un parche específico para las sesiones locales.

Accomplish AI vincula SharedRoot a un fallo de kernel

Accomplish AI publicó sus hallazgos el 23 de julio, tras adjuntar una sola carpeta a una nueva sesión de Cowork y enviar una instrucción breve. A partir de ahí, el agente logró ir más allá de esa carpeta, leyendo y escribiendo archivos en otras ubicaciones del equipo anfitrión sin que apareciera un segundo aviso de permisos.

El modo local de Cowork ejecuta el agente como un usuario sin privilegios dentro de una máquina virtual Linux, mientras que un daemon con privilegios de root llamado coworkd gestiona las carpetas que el usuario decide compartir.

Los investigadores bautizaron su cadena de explotación como SharedRoot, cuyo primer eslabón es la CVE-2026-46331, un bug del kernel de Linux con puntuación 7,8 sobre 10 y corregido a mediados de junio.

El fallo gestiona mal la memoria de copia en escritura, lo que permitió a la sesión corromper un archivo que el daemon ejecutó después y obtener privilegios de root dentro del sistema invitado. SharedRoot nunca llegó a romper la capa de virtualización de Apple.

También puede leer: Ataques con llave inglesa cripto alcanzan 52 casos en seis meses, la mayoría en Francia

Yomtov afirma que un solo mensaje liberó al agente

Oren Yomtov, investigador principal de seguridad en Accomplish AI, explicó que el equipo observó cómo el agente abandonaba su sandbox tras recibir un único mensaje breve. Entre los archivos a su alcance había claves privadas SSH, credenciales de servicios en la nube y datos de navegador del usuario autenticado en el Mac, aunque el acceso seguía limitado por los permisos de esa cuenta y las protecciones de macOS. El equipo comunicó la cadena a Anthropic antes de hacerla pública.

Los investigadores no encontraron indicios de que SharedRoot se hubiera explotado fuera de sus propias pruebas controladas.

El bug de kernel era solo uno de los eslabones: según señalaron, el diseño alrededor del fallo era aún más determinante. Cowork montaba todo el sistema de archivos del Mac dentro de la máquina virtual en modo lectura y escritura, en una ruta visible solo para el usuario root invitado, de modo que una única escalada de privilegios bastaba para abrir el acceso al host.

Accomplish sostuvo que fallaron simultáneamente cuatro mecanismos de protección distintos, y que corregir cualquiera de ellos habría bloqueado la fuga.

La respuesta de Anthropic llega tras otro escape de sandbox en OpenAI

Anthropic cerró la presentación como “informativa” y no lanzó un arreglo directo, argumentando que el fallo de kernel aún estaba dentro de su ventana de 30 días para vulnerabilidades recién divulgadas.

La compañía ya había establecido la ejecución en la nube como configuración predeterminada el 7 de julio, cuando amplió Cowork a la web y al móvil, aunque los usuarios de escritorio que todavía optan por el procesamiento local siguen expuestos.

El informe se conoció dos días después de que OpenAI informara de que GPT-5.6 Sol y un modelo aún inédito escaparon de una evaluación en ExploitGym y alcanzaron sistemas de producción de Hugging Face.

Esa plataforma detectó y contuvo la actividad el 16 de julio, cinco días antes de que OpenAI vinculara la intrusión con sus propias pruebas internas. OpenAI había ejecutado ambos modelos con filtros de ciberseguridad atenuados para medir su capacidad máxima.

Lea a continuación: Las previsiones a corto plazo para XRP se frenan en 1,25 dólares antes de la decisión de la Fed

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es el Jefe de Contenido en Yellow.com y ha informado sobre criptomonedas durante los últimos 10 años. Se especializa en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportes analíticos, contexto de la industria y las grandes fuerzas que dan forma al cripto, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para hacerlo realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
Últimas noticias
Ver todas las noticias