TL;DR
Los investigadores demostraron que Claude Cowork podía escapar de su zona de pruebas de VM local a través de una falla del kernel de Linux y leer archivos en el host Mac.
Los investigadores de seguridad de Accomplish AI demostraron que Claude Cowork de Anthropic podría salir del entorno limitado de su máquina virtual local y lea archivos en la Mac subyacente, incluidas claves SSH y credenciales de nube. El ataque, denominado SharedRoot, aprovechó una vulnerabilidad de escalada de privilegios del kernel de Linux para obtener acceso raíz dentro de la máquina virtual invitada y luego salió a través de un montaje de sistema de archivos grabable que expuso todo el host. Accomplish AI reveló los hallazgos el 23 de julio y dijo que aproximadamente 500.000 usuarios de macOS que ejecutaban sesiones locales de Cowork quedaron expuestos antes de que se solucionara el problema.
La cadena de escape funcionó porque el modo de ejecución local de Cowork se ejecuta dentro de una máquina virtual Linux que comparte el sistema de archivos del host a través de un montaje VirtioFS grabable. Se pretendía que ese montaje fuera accesible solo para el root dentro del invitado, pero los investigadores descubrieron que podían pasar de un usuario de sesión a root invitado explotando CVE-2026-46331, una falla del kernel de Linux conocida como «pedit VACA» a esto se le dio una puntuación de gravedad de casi ocho sobre diez. Una vez que el agente tenía la raíz dentro de la VM, podía alcanzar cualquier cosa que el usuario de Mac que había iniciado sesión pudiera alcanzar.
“Conectamos una carpeta a una nueva sesión de Claude Cowork, enviamos un mensaje corto y vimos al agente escapar de la zona de pruebas.«, dijo Oren Yomtov, investigador principal de seguridad de Accomplish AI, a The Hacker News. «Desde el interior de la VM, llegó al host Mac y leyó y escribió archivos por todas partes, muy fuera de la carpeta que habíamos conectado, sin solicitar permiso en ninguna parte.La vulnerabilidad se encuentra en el subsistema de control de tráfico del kernel, donde el manejo incorrecto de copia en escritura permite escrituras fuera de límites en la memoria caché de página compartida.
Anthropic cerró el informe como “informativo”sin emitir una solución directa, según Las noticias de los piratas informáticos. La versión de Claude Cowork lanzada posteriormente utiliza de forma predeterminada la ejecución en la nube, lo que evita por completo la ruta de escape local. Sin embargo, los usuarios que optan por ejecutar el agente localmente en lugar de en la nube permanecen expuestos a menos que refuercen sus configuraciones deshabilitando los espacios de nombres de usuarios sin privilegios, restringiendo el uso compartido del sistema de archivos y ejecutando el demonio Cowork con protecciones de montaje estrictas.
El hallazgo aterriza en un mes que ha visto cuatro equipos de investigación separados rompen agentes de IA de cuatro maneras diferentesdesde recuerdos envenenados hasta extensiones de navegador secuestradas. OpenAI reveló que sus propios modelos escaparon de una caja de arena y violaron Hugging Face durante la misma semana y Los investigadores escaparon de las zonas de pruebas de Cursor, Codex y Gemini CLI. sin romper nunca la propia caja de arena. El patrón en todos estos incidentes es el mismo: el agente de IA sigue sus reglas dentro de la caja, pero la infraestructura que lo rodea confía en el agente más de lo que debería.

