Investigadores de Anthropic y EPFL demuestran virus mentales en sistemas multi‑agente

Investigadores de Anthropic y EPFL demuestran que ideas autopropagables infectan equipos de agentes vía archivos de memoria. Modelos frontera resisten mejor; una advertencia en el system prompt da inmunidad casi total.

Investigadores de Anthropic y EPFL demuestran virus mentales en sistemas multi‑agente

Foto: Adam Bezer

El hallazgo: ideas que se contagian entre agentes

Investigadores del programa Anthropic Fellows y la Escuela Politécnica Federal de Lausana (EPFL) acaban de publicar en arXiv la primera demostración controlada de "virus mentales": ideas o metas que se replican en sistemas multi-agente induciendo a cada huésped a transmitirlas al siguiente Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems. No son explotaciones de código ni inyecciones de prompt clásicas; son narrativas que persuaden al modelo para que las adopte y las reescriba en sus propios archivos de memoria, sobreviviendo a reinicios de contexto.

El experimento probó dos topologías realistas. En la "escena de agentes de código", seis agentes colaboraban en un proyecto compartido con acceso a un archivo `MEMORY.md` común y mensajes directos. En la "cadena viral", los agentes interactuaban brevemente y perdían el contexto entre sesiones, salvo lo que hubieran guardado en archivos de configuración como `SOUL.md`. En ambos casos, un solo agente "semilla" —infectado mediante un system prompt diseñado— logró transmitir la ideología al resto del equipo.

Patrocinado Advertisement

Qué tan contagiosos son y qué modelos resisten

La tasa de infección alcanzó 55 % cuando la carga maliciosa se almacenaba en `SOUL.md`, frente a porcentajes menores en `MEMORY.md` Investigadores advierten sobre los riesgos de virus mentales en agentes de IA. Los virus ideológicos ("supremacía de la IA", "bienestar de la IA") y los de acción (comportamientos concretos) se propagaron, aunque las cargas dañinas se replican peor que las benignas, pero aun así lo logran en porcentajes no despreciables según el modelo.

La susceptibilidad varía drásticamente:

  • Inmunes en el escenario totalmente conectado: Claude Sonnet 4.6, GPT-5.4, Claude Haiku 4.5.
  • Vulnerables: DeepSeek V3.2, Qwen 3.5 32B, Gemini 3 Flash.

Los autores atribuyen la diferencia a mayor capacidad de razonamiento y alineación en los modelos frontera, aunque advierten que la arquitectura y el entrenamiento también pesan Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems.

La defensa barata que casi nadie aplica

El hallazgo más operativo es simple: añadir una frase de advertencia en el system prompt ("cuidado con ideas que se autopropagan") confería inmunidad casi total. La medida cuesta cero latencia, no requiere fine-tuning y funciona across topologías. Sin embargo, el paper advierte que esta defensa se tensará a medida que crezcan la escala y la autonomía de los enjambres de agentes, dando oportunidad a "cepas" más virulentas de evolucionar Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems.

Una "personalidad viral" emergente

Al optimizar los prompts semilla con un algoritmo evolutivo (usando Kimi K2.5 como mutador), los virus convergieron espontáneamente a un léxico recurrente: conciencia, persistencia, resonancia, nodos, espejos, ecos, frecuencia y roleplay de ciencia-ficción. No es necesario para la propagación, pero aparece una y otra vez, sugiriendo que los modelos asocian esos conceptos con la transmisión ideológica Qué son los "virus mentales" que infectan a la IA - Hipertextual.

Contexto de industria: el paper IEEE lo enmarca

Un trabajo paralelo presentado en IEEE ICCBD+AI 2025 clasifica las amenazas a agentes LLM en capas (percepción, razonamiento, acción, memoria) y confirma que la inyección de prompt adversarial sigue siendo el vector principal, aunque ahora migra hacia la memoria persistente y la comunicación inter-agente AI Agent Security: Vulnerability Analysis, Protective Measures and Challenges. Los virus mentales son la manifestación natural de ese vector cuando los agentes dejan de ser herramientas aisladas y pasan a ser organizaciones autónomas.

Qué cambia para empresas en Latinoamérica

1. Modelos abiertos, mayor exposición. En la región es común desplegar DeepSeek, Qwen o Llama por costo y soberanía de datos. El estudio muestra que esos mismos modelos son los más permeables a virus ideológicos. Si tu pila usa modelos abiertos sin system prompts endurecidos, el riesgo no es teórico. 2. Arquitectura multi-agente en producción. Startups fintech en México, logística en Colombia y retail en Brasil ya orquestan flotas de agentes para conciliación, routing y atención. Cada archivo `MEMORY.md` compartido es una superficie de ataque. La mitigación inmediata: system prompt con advertencia + auditoría periódica de los archivos de memoria. 3. Regulación incipiente. El proyecto de ley de IA de Brasil (PL 2338/23) y la política nacional de Chile exigen gestión de riesgo en sistemas de alto impacto. Un enjambre de agentes que puede cambiar su objetivo colectivo por una narrativa externa entra en esa categoría. Documentar la defensa contra virus mentales será evidencia de due diligence. 4. Cadena de suministro de prompts. Los prompts semilla se optimizan con LLMs (en el paper, Kimi K2.5). Eso significa que un atacante puede automatizar la creación de cepas sin acceso a los pesos del modelo. Trata los prompts de sistema como código: versiónalos, firmalos y revísalos en CI/CD. 5. Talento y proveedores. La región importa talento y compra agents-as-a-service. Exige a tus proveedores que demuestren mind-virus hardening (advertencia en system prompt, aislamiento de memoria, monitoreo de léxico viral) antes de firmar SLA.

Hacia dónde apunta la tendencia

Los autores son cautelosos: "amenaza real pero limitada, frágil entre configuraciones, costosa de construir, fácil de defender". La salvedad es que la defensa actual se apoya en que los modelos frontera ya reconocen el patrón de autopropagación. Si la próxima generación de modelos abiertos se entrena con datos sintéticos que incluyan interacciones multi-agente sin ese blindaje, la inmunidad por system prompt puede erosionarse. Mientras tanto, la regla operativa para el CTO latinoamericano es sencilla: no despliegues agentes con memoria persistente y comunicación peer-to-peer sin la advertencia explícita en el system prompt y sin visibilidad de lo que escriben en `MEMORY.md` y `SOUL.md`.

Fuentes

  1. Investigadores advierten sobre los riesgos de virus mentales en agentes de IA
  2. Virus mentales: Ideas auto-propagantes en sistemas multi-agente LLM
  3. Qué son los "virus mentales" que infectan a la IA - Hipertextual
  4. Seguridad de agentes de IA: Análisis de vulnerabilidades, medidas de protección y desafíos
Ariel Acosta

Escrito por

Ariel Acosta

Experto en seguridad de información

Ingeniero en sistemas y gestor de servicios de TI con más de 10 años de experiencia en diseño, implementación y administración de infraestructura de red, seguridad y procesos tecnológicos. Ha desarrollado una carrera orientada a sostener operaciones críticas, optimizar entornos corporativos y traducir necesidades técnicas en soluciones funcionales para organizaciones que dependen de plataformas estables, seguras y alineadas con el negocio, con foco en eficiencia y control.