La vulnerabilidad zero-day descubierta en Muse, el asistente de Meta, no es un incidente aislado: es la confirmación empírica de una falla arquitectónica que la industria ha ignorado por conveniencia. Mark Zuckerberg aseguró que el producto fue «construido desde cero para privacidad y seguridad». La realidad técnica demuestra lo contrario: una falla que permite a cualquier aplicación local o comando de terminal tomar control total del agente. Amazon, por su lado, no esperó explicaciones y bloqueó el acceso a Muse desde su infraestructura el domingo siguiente.
El problema de los privilegios excesivos
Para que un asistente «reserve citas, complete formularios, gestione atención al cliente, realice compras y se conecte con sus aplicaciones favoritas», como promete Meta, el usuario debe entregarle las llaves del reino: acceso a WhatsApp, correo, calendario, redes sociales, micrófono, cámara, ubicación y sistema de archivos. En macOS, Muse anula las defensas que Apple ha perfeccionado durante años para aislar aplicaciones. El asistente se convierte, de facto, en un superusuario sin auditoría ni contención.
Este patrón no es exclusivo de Meta. La nueva generación de agentes autónomos —OpenClaw, Claude Code, y sus ecosistemas de «skills» o extensiones— opera bajo la misma premisa: delegar credenciales válidas y control de sistema a una entidad de software que razona en lenguaje natural y ejecuta código. La superficie de ataque se expande hasta volver inmanejable el modelo de amenazas tradicional.
La cadena de suministro como vector de ataque
ESET documenta en su investigación sobre la campaña ClawHavoc más de 800 skills maliciosas distribuidas en ClawHub, el mercado oficial de OpenClaw. Los atacantes no necesitan vulnerar el agente: basta con publicar una extensión envenenada —disfrazada de herramienta para Google Workspace o trader de Polymarket— que el usuario instala voluntariamente. El archivo SKILL.md, simple documentación en texto plano, se arma como vehículo de ingeniería social: instrucciones falsas que llevan a la víctima a ejecutar comandos en terminal que descargan malware como Atomic Stealer, diseñado para robar billeteras de criptomonedas, claves SSH y contraseñas en macOS.
El typosquatting (nombres casi idénticos a paquetes legítimos) y los prerrequisitos falsos completan el arsenal. Una vez instalada, la skill hereda todos los permisos del agente anfitrión. No hay sandbox, no hay revisión de código efectiva, no hay control de integridad.
Filtración silenciosa: los rastreadores que nadie ve
LeakyLM revela una capa de riesgo distinta pero convergente: las interfaces web de Perplexity, Claude, ChatGPT y Grok integran rastreadores de terceros —Meta Pixel, Google Analytics, TikTok, Datadog, Intercom— que capturan URLs de conversación, títulos de chat, hashes de correo electrónico y cookies de publicidad. En varios casos, la transmisión ocurre aunque el usuario rechace las cookies no esenciales, mediante llamadas servidor-a-servidor invisibles para el navegador y los bloqueadores de anuncios.
Grok envía capturas de pantalla completas de chats compartidos a TikTok a través de metadatos Open Graph. Claude reenvía eventos a once plataformas de seguimiento vía Segment, incluyendo el correo del usuario y el identificador de la conversación. Perplexity codifica el texto de la primera consulta en la URL que recibe Meta Pixel. ChatGPT envía títulos de página a Google Analytics en cuentas gratuitas sin respetar el consentimiento. La promesa de privacidad choca contra la arquitectura de monetización de datos.
El factor humano: usuarios como vector
Un estudio de IEEE con 3.270 adultos en Reino Unido encontró que un tercio de usuarios semanales de asistentes conversacionales exhibe comportamientos que habilitan ataques, y un cuarto ha intentado «jailbreak» por curiosidad o entretenimiento. La mitad dice sanitizar datos, pero algunos comparten contraseñas. La mayoría desconoce que sus interacciones pueden usarse para entrenar modelos y que existen opciones de exclusión (opt-out). La interfaz conversacional antropomorfa amplifica la confianza y reduce la cautela.
Gobernanza: de la reacción a la estructura
Muliarevych propone para instituciones académicas un marco de seis capas —gobernanza y política, clasificación de datos y privacidad, arquitectura segura, seguridad de prompts y salidas, supervisión humana y alfabetización en IA, monitoreo y mejora continua— que ofrece una plantilla adaptable al entorno corporativo. Tratar a los asistentes de IA como sistemas socio-técnicos sensibles a seguridad y privacidad implica:
- Clasificar qué datos pueden y no pueden tocar estos agentes.
- Exigir arquitectura de menor privilegio: aislamiento, sandboxing, credenciales de alcance limitado.
- Auditar y aprobar extensiones (skills) antes de su despliegue, con análisis estático y dinámico obligatorio.
- Bloquear rastreadores de terceros en entornos corporativos mediante políticas de red y configuración de navegadores gestionados.
- Formar a los equipos en riesgos de inyección de prompts, suplantación de habilidades y fuga de datos por canales laterales.
- Establecer trazabilidad y auditoría continua de qué agente accedió a qué recurso, cuándo y por qué.
Cierre
Muse presenta una vulnerabilidad que no es un bug: es la consecuencia inevitable de un modelo que prioriza la demostración de capacidades sobre la contención de riesgos. Mientras los proveedores compitan por el asistente más «proactivo» y «autónomo», la seguridad seguirá siendo una promesa de marketing. La pregunta para el directorio no es si adoptar estas herramientas, sino bajo qué controles técnicos y contractuales se les permite operar. Si su organización ya entregó credenciales de correo, calendario y almacenamiento a un agente que crea sus propias herramientas «en tiempo real», la superficie de ataque ya está expuesta. La gobernanza no puede esperar al próximo zero-day.