El ASCII smuggling: de la inyección en IA al spam invisible

El ASCII smuggling: de la inyección en IA al spam invisible

Foto: Mika Baumeister

Microsoft registró un salto exponencial en las detecciones de ASCII smuggling: pasó de unas 21.000 detecciones diarias a 1,3 millones y luego a 2,5 millones, según publicó Diariobitcoin. La técnica, que hace dos años se popularizó como forma de hacer más sigilosos los ataques de inyección de prompts contra modelos de inteligencia artificial, ahora es adoptada por spammers para romper palabras clave y evadir los filtros de correo masivo, de acuerdo con Ars Technica.

El mecanismo es simple en concepto. Un bloque de 128 etiquetas Unicode imita casi perfectamente una porción del código ASCII, con una diferencia decisiva: los caracteres que codifica son legibles para las computadoras pero casi invisibles para las personas. La etiqueta U+E0041 replica la letra A, y U+E0061 replica la a. En un correo procesado por un modelo de lenguaje, las instrucciones maliciosas se detectan; el lector humano nunca las ve.

La adopción por parte de los spammers confirma un patrón conocido en seguridad: las técnicas que nacen contra la IA no desaparecen, mutan hacia infraestructura más débil y masiva, como el correo electrónico.

Patrocinado Advertisement

El mismo punto ciego, nuevo carrier

La migración, sin embargo, no se detiene en el Unicode. Una investigación de Lineaje Inc. y la Universidad Estatal de Arizona, aceptada como póster en el taller FAGEN@ICML 2026, muestra que los guardarraíles que inspeccionan solo texto fallan cuando la señal maliciosa viaja en arreglos de números flotantes, como parámetros de generación procedural.

En 14.400 ataques contra APIs comerciales de tres proveedores, el carrier basado en sistemas de funciones iteradas alcanzó una tasa de fuga del 94,3% frente a un ensamble de defensa de dos capas —un clasificador de Meta y un filtro estadístico de términos— mientras el mismo payload escrito en texto plano fue detectado en cada muestra una vez activado el clasificador. La diferencia no estaba en el contenido, sino en el vehículo: cuando la instrucción entra al contexto del modelo a través de un canal numérico reconstruido, la inspección textual ya no tiene evidencia sobre la cual actuar.

El detalle relevante del modelo de amenaza es que el atacante no modifica el código de reconstrucción. Controla solo los arrays numéricos que el pipeline confía y reconstruye antes de enviarlos al modelo. Como la instrucción no es visible como texto ni en la configuración cruda ni en el reporte generado, no hay una capa textual donde bloquearla. La investigación cuantifica el punto ciego: el ensamble defensor no detectó ninguno de los carriers numéricos a nivel de muestra, y su confianza máxima sobre esas muestras fue de 0,225 frente a un umbral de 0,5.

El riesgo no es solo el spam invisible. Los pipelines que consumen telemetría, configuraciones o salidas de herramientas estructuradas comparten la misma suposición frágil: que el contenido malicioso se va a ver como texto en alguna capa.

Los autores del estudio advierten que un detector simple de volcado hexadecimal bloquea el formato actual del ataque, pero que esa es una firma de presentación, no una defensa general contra la clase de carrier numérico. La pregunta operativa para un equipo de seguridad en la región no es si su proveedor detecta Unicode, sino si su pipeline valida semánticamente los canales numéricos antes de dárselos al modelo. El siguiente carrier ya no será texto invisible: serán números que parecen legítimos.

Fuentes

  1. Antes popular para atacar la IA, el contrabando ASCII es adoptado por los spammers
  2. 🚨 Microsoft registra un salto del “ASCII smuggling” en spam ...
  3. Ocultos en flotantes a plena vista: portadores esteganográficos para la inyección indirecta de prompts y contenido
Valmis Di Carlo

Escrito por

Valmis Di Carlo

Especialista en infraestructura

Especialista en administración de sistemas UNIX/Linux, ciberseguridad e infraestructura tecnológica, con experiencia en consultoría TI, investigación computacional y operación de entornos críticos. Desde DICATECH, SRL, combina dominio técnico en OpenBSD, FreeBSD, Solaris y GNU/Linux con una mirada práctica sobre seguridad, continuidad y arquitectura de servicios, ayudando a organizaciones a construir plataformas más estables, seguras, auditables, escalables y resilientes.