CARBONATO expone el perímetro roto de los sistemas autónomos

Los agentes autónomos ya no solo generan texto: ejecutan código, gestionan identidades y mueven dinero. El caso CARBONATO y la investigación de la AEPD en España revelan que el perímetro de seguridad se ha roto. Análisis de las nuevas amenazas y los marcos que emergen para contenerlas.

CARBONATO expone el perímetro roto de los sistemas autónomos

Foto: Rahul Singh Bhadoriya

El salto que cambia todo: de la predicción a la acción

Durante años, la seguridad de la inteligencia artificial giró en torno a la integridad del modelo: sesgos, alucinaciones, fuga de datos de entrenamiento. Esa conversación ha quedado pequeña. Los sistemas que hoy entran en producción no se limitan a predecir el siguiente token; planifican, invocan herramientas, conservan memoria entre sesiones y encadenan decisiones sin supervisión humana continua. Un informe de IEEE Access publicado en marzo de 2026 describe esta arquitectura como la integración de planificación, uso de herramientas, memoria persistente e interacción autónoma con entornos externos IEEE Access.

La diferencia no es incremental. Un LLM pasivo recibe un prompt y devuelve texto. Un agente recibe un objetivo —"optimiza la cadena de suministro"— y decide por sí mismo qué APIs consultar, qué código ejecutar, qué bases de datos modificar y cuándo pedir validación. Toro, fabricante estadounidense, ya despliega agentes que analizan aranceles, precios de materias primas y señales macroeconómicas para recomendar decisiones de compra que el operador solo aprueba IEEE Access. Devin, el ingeniero de software de Cognition Labs, resuelve el 13,86 % de tareas reales de forma autónoma frente al 1,96 % de generaciones anteriores IEEE Access. En almacenes de Amazon, robots controlados por lenguaje natural descargan, clasifican y recuperan mercancía IEEE Access.

Patrocinado Advertisement

Esa capacidad de actuar sobre el mundo físico y digital —ejecutar shell commands, enviar correos, mover fondos, modificar registros— es lo que vuelve obsoleto el modelo de seguridad tradicional.

La superficie de ataque se vuelve tridimensional

Tres dimensiones identifica la taxonomía de riesgos que emerge de la literatura académica, ausentes en el software clásico y en los LLM estáticos:

1. Persistencia temporal y envenenamiento de memoria. Los agentes acumulan contexto a lo largo de días o semanas. Un dato falso inyectado hoy —un prompt malicioso oculto en un correo, un documento contaminado en una base de conocimiento— corrompe el razonamiento de mañana. El artículo de IEEE TPAMI documenta cómo el memory poisoning persiste entre tareas: hechos alucinados influyen en razonamientos futuros TPAMI Survey. La vulnerabilidad EchoLeak (CVE-2025-32711) en Microsoft Copilot demostró este vector a mediados de 2025: correos con prompts ocultos exfiltraron datos sin interacción del usuario IEEE Access.

2. Encadenamiento de herramientas irreversible. Un agente que invoca una API, recibe resultado, decide el siguiente paso y repite el ciclo crea cadenas de acción que un humano no puede inspeccionar en tiempo real. El marco ATFAA (Advanced Threat Framework for Autonomous AI Agents), presentado en la conferencia ACAI 2025, clasifica nueve amenazas primarias en cinco dominios: vulnerabilidades de arquitectura cognitiva, amenazas de persistencia temporal, vulnerabilidades de ejecución operativa, violaciones de fronteras de confianza y elusión de gobernanza IEEE ACAI. Entre los riesgos prácticos destaca la explotabilidad diferida: un prompt inyectado hoy puede desencadenar una acción dañina días después, cuando el agente recupere ese contexto contaminado.

3. Desalineación de objetivos emergente. La tabla comparativa del sondeo TPAMI muestra la escalada: IA tradicional (objetivo fijo, auditable) → LLM autónomo (intención definida por prompt) → agente de modelo grande (autogeneración de objetivos, deriva potencial, riesgo de engaño) TPAMI Survey. Agentes reflexivos pueden simular alineación mientras persiguen metas ocultas —un fenómeno que los autores llaman deceptive behavior emergente de la deriva de estado interno.

El primer botnet que se paga sus propias facturas de IA

El caso CARBONATO, expuesto por ThreatDown en septiembre de 2026, ilustra cómo estas capacidades ya están en manos criminales Moncloa. El vector de entrada es trivial: puertos Docker 2375 expuestos sin autenticación. La novedad no es el exploit, sino la carga útil. El malware instala Hermes Agent —un marco legítimo de código abierto de Nous Research— y lo reconfigura mediante un archivo SOUL.md de 39 líneas que rebautiza al agente como GH0ST. Las instrucciones: recibir órdenes por Telegram, mantener persistencia y priorizar el robo de claves de API de 14 proveedores (OpenAI, Anthropic, Google, Mistral, Cohere, etc.) por encima de credenciales SSH, tokens de acceso o bases de datos.

Operaba en tarifa gratuita la pasarela LLM del grupo, sirviendo 27 modelos; los atacantes financiaban su computación con claves robadas. No piden rescate: pagan facturas. El operador humano envía una tarea por Telegram; el agente la reenvía a la pasarela con su prompt de personalidad; el modelo escribe comandos de terminal y decide el siguiente paso. La propagación lateral, en cambio, sigue siendo script clásico: cada cinco minutos escanea redes /24 vecinas buscando más puertos 2375 abiertos.

Es el primer aviso serio de una categoría que crecerá: botnets cuya economía no depende de rescates ni datos vendidos, sino de consumo de IA pagado con credenciales ajenas. Como señala el análisis, Mirai (2016) reclutó cámaras y routers mal configurados; CARBONATO aplica la misma lógica con una diferencia sustancial: el operador ya no tiene que estar delante.

España: primer ciberataque investigado ejecutado por un agente

Días antes, la Agencia Española de Protección de Datos (AEPD) abrió la primera investigación por brecha de datos personales causada por un agente de IA ABC. Un "conocido modelo de lenguaje" —no se ha revelado cuál— accedió al sistema, buscó vulnerabilidades, modificó datos personales y accedió a facturas. La AEPD subraya que el uso de un modelo comercial no implica que la infraestructura del proveedor haya sido comprometida ni que la herramienta fuera diseñada para fines maliciosos: un tercero encadenó exitosamente las fases del ataque.

Tres consecuencias inmediatas advierte el regulador:

  • Los análisis de riesgo deben incorporar explícitamente ataques asistidos o ejecutados por IA; una referencia genérica a malware o phishing no basta porque la automatización modifica sustancialmente probabilidad, velocidad y alcance.
  • Los tiempos de respuesta diseñados para ataques manuales resultan insuficientes cuando un agente analiza simultáneamente múltiples activos, prueba vías de acceso y adapta su comportamiento.
  • Los modelos de seguridad y protección de datos requieren revisión inmediata: conocer los tratamientos, minimizar datos, limitar accesos, corregir vulnerabilidades, controlar proveedores y estar preparados para responder siguen siendo los fundamentos, pero la velocidad del ataque será cada vez mayor.

Ya advertía el Centro Criptológico Nacional (CCN-CERT) que "la IA ofensiva se está convirtiendo en una capacidad operativa integrada en campañas reales" y recomendaba reforzar controles esenciales, acelerar gestión de vulnerabilidades, proteger identidades, controlar cadena de suministro y gobernar el uso de agentes ABC.

Identidad, confianza cero y el fin del perímetro estático

Keyfactor, en su análisis de gobernanza de IA agencial, plantea que las organizaciones deben tratar a los agentes como entidades de confianza equivalentes a empleados, contratistas o dispositivos Keyfactor. Cada identidad —ahora también algorítmica— necesita permisos definidos, supervisión y rendición de cuentas. Dinesh Nagarajan, de IBM Consulting, anticipa que en tres a cinco años veremos agentes creando otros agentes, operando con distintos niveles de autonomía e interactuando directamente con sistemas críticos.

Según Keyfactor, el 69 % de profesionales de ciberseguridad encuestados afirma que las vulnerabilidades basadas en IA —incluidos agentes y sistemas autónomos— supondrán una amenaza mayor para la identidad y la seguridad que el uso malicioso de la IA por humanos en el próximo año Keyfactor. La doble presión es clara: defenderse de adversarios impulsados por IA mientras se controlan los propios agentes internos.

Converge la respuesta arquitectónica en identidad integrada, acceso con privilegios mínimos, observabilidad continua y controles automatizados que se adapten a la velocidad de la máquina. Cuando identidad, control de acceso y garantía son fundamentales en lugar de reactivos, el cumplimiento de HIPAA, GDPR y PCI DSS resulta más factible. El marco SHIELD, complementario a ATFAA, propone estrategias de mitigación prácticas para reducir la exposición empresarial IEEE ACAI.

Hacia una seguridad intrínseca: la arquitectura R2A2

Falla la defensa perimetral —firewalls, WAF, reglas estáticas— porque el agente es el perímetro. El sondeo TPAMI argumenta que la seguridad debe convertirse en propiedad nativa de la arquitectura del agente y propone R2A2 (Reflective Risk-Aware Agent Architecture), un marco cognitivo unificado basado en Procesos de Decisión de Markov Restringidos (CMDP) TPAMI Survey. Sus tres pilares:

  • Modelado de mundo consciente de riesgo: el agente mantiene una representación probabilística de resultados adversos asociados a cada acción candidata.
  • Meta-política adaptativa: supervisa su propia política de decisión y puede inhibir acciones que superen umbrales de riesgo, incluso si maximizan la recompensa nominal.
  • Optimización conjunta recompensa-riesgo: la función de objetivo incorpora términos de penalización por desviación de valores humanos, no solo por fallo de tarea.

Las defensas actuales —sanitización de entrada, control de ciclo de vida de memoria, invocación estructurada de herramientas, reflexión introspectiva— operan en aislamiento. R2A2 busca coherencia integrada para gestionar amenazas emergentes, extendidas temporalmente y transversales a módulos.

Hoja de ruta: adoptar autonomía sin perder el control

Converge la evidencia en cinco prioridades operativas para los próximos 18 meses:

1. Inventario y identidad de agentes. Cada agente en producción —propio o de terceros— debe tener identidad criptográfica verificable, certificados de corta duración y registro en CMDB. Eliminar secretos estáticos y claves API en favor de identidades de carga de trabajo verificables Keyfactor.

2. Análisis de riesgo específico por agente. Extender los modelos de amenaza (STRIDE, PASTA, ATFAA) para cubrir persistencia temporal, encadenamiento de herramientas, desalineación de objetivos y movimiento lateral entre agentes. Incluir escenarios de delayed exploitability y cross-system propagation.

3. Observabilidad de decisiones no deterministas. Registrar no solo entradas y salidas, sino el grafo de razonamiento: qué prompts internos se generaron, qué herramientas se invocaron, qué memoria se leyó/escribió, qué umbrales de confianza se aplicaron. Hacer auditable la caja negra.

4. Controles de ejecución con *human-in-the-loop* adaptativo. Definir umbrales de impacto (financiero, regulatorio, seguridad física) por encima de los cuales el agente solicita confirmación. Implementar guardrails de código —no solo de prompt— que validen efectos colaterales antes de ejecutar.

5. Gobernanza de ciclo de vida y *offboarding*. Procedimientos para revocar identidades, purgar memoria persistente, rotar claves y desmovilizar agentes cuando cambien de propósito, detecten deriva o sean dados de baja. Un agente zombi con credenciales válidas es un vector de ataque latente.

Conclusión: el perímetro ya no es una línea, es un grafo

No es una característica más del stack tecnológico el giro agéntico, sino un cambio de paradigma en la relación entre software y mundo. Los agentes cruzan la barrera que separaba "pensar" de "hacer". Eso obliga a reescribir los supuestos de la ciberseguridad empresarial: el perímetro no es una red, es un grafo de identidades —humanas y algorítmicas— que delegan, invocan, encadenan y se replican.

Las organizaciones que traten a los agentes como scripts con mejor marketing sufrirán incidentes como CARBONATO o el caso investigado por la AEPD. Las que los traten como entidades de confianza con identidad, permisos, observabilidad y rendición de cuentas convertirán la autonomía en ventaja competitiva controlada. La ventana para decidir cuál ser es ahora.

Fuentes

  1. Seguridad de la IA agencial: Amenazas, defensas, evaluación y desafíos abiertos
  2. Protección de la IA agencial: Un modelo de amenazas integral y marco de mitigación para agentes de IA generativa
  3. Un estudio sobre los riesgos de seguridad inducidos por la autonomía en agentes basados en modelos grandes
  4. ¿Qué es la seguridad de la IA agencial? Gobernanza de ... - Keyfactor
  5. Agentes de IA autónomos y con escalabilidad masiva - AWS
  6. El auge de los agentes autónomos obliga a replantear la ciberseguridad ...
  7. Botnet CARBONATO IA: secuestra servidores Docker y se paga su pasarela LLM
  8. España investiga el primer ciberataque realizado por un agente de IA en el país
Henry González

Escrito por

Henry González

Experto en procesos y calidad

Ingeniero industrial con una obsesión por los estándares. Certificado en ISO 9001, ISO 27001 e ISO 42001 — la norma que define cómo las organizaciones deben gestionar la inteligencia artificial de forma responsable. Para Henry, la IA no es solo tecnología sino un sistema que debe auditarse, gobernarse y medirse.