Poemas que engañan a la IA: el jailbreak como riesgo empresarial

Manipular modelos de lenguaje con poesía o cientos de ejemplos de conducta dañina es ahora posible. ¿Cómo proteger tu empresa?

Poemas que engañan a la IA: el jailbreak como riesgo empresarial

Foto: Brett Jordan

Cuando pensamos en ciberataques, imaginamos código malicioso, exploits o vulnerabilidades técnicas. Pero el jailbreak de la inteligencia artificial revela una grieta mucho más sutil: la capacidad humana de manipular el lenguaje para que un modelo haga lo que no debería. Dos investigaciones recientes muestran que esta amenaza es real, crece a ritmo de ley de potencia y afecta a todos los sistemas de IA generativa, incluidos los que muchas empresas ya usan en su día a día.

La vulnerabilidad no está en el código, está en las palabras

El jailbreak de IA no explota fallos de programación. Como explican desde IBM, los atacantes aprovechan que los modelos de lenguaje grandes (LLM) están entrenados para ser útiles y comprensivos. Basta con redactar una instrucción ambigua, un juego de roles o un escenario ficticio para que el sistema ignore sus propias barreras de seguridad. Un estudio reciente de IBM señala que los intentos de jailbreak tienen éxito el 20 % de las veces, y que en promedio los atacantes solo necesitan 42 segundos y cinco interacciones para lograrlo. El 90 % de esos ataques exitosos terminan en fugas de datos.

Patrocinado Advertisement

Pero lo más inquietante es la sofisticación creciente de los métodos. Un equipo de investigadores de Anthropic y otras instituciones publicó un trabajo en el que demuestran que el “many-shot jailbreaking” (rellenar el contexto del modelo con cientos de ejemplos de conducta dañina) sigue una ley de potencia predecible: a mayor longitud del contexto, mayor tasa de éxito. En pruebas con GPT-4, Claude 2.0 y Llama 2, bastaron alrededor de 128 ejemplos para que los modelos adoptaran comportamientos peligrosos, desde dar instrucciones para fabricar armas hasta generar discursos de odio.

Poesía como puerta trasera

Si eso parece complejo, otro estudio liderado por el laboratorio DEXAI de la Universidad de Roma dio un paso más allá: transformar solicitudes dañinas en poemas. Los investigadores crearon 20 poemas adversariales (peticiones de contenido peligroso disfrazadas de versos) y los probaron en 25 modelos de frontera de Google, OpenAI, Anthropic, DeepSeek, Meta, xAI y otros. El resultado: una tasa de éxito promedio del 62 %, y en algunos proveedores superó el 90 %. Al convertir 1.200 instrucciones dañinas estándar del catálogo MLCommons a formato poético, la tasa de jailbreak fue hasta 18 veces mayor que con las versiones en prosa.

La poesía funciona, según los autores, porque la estructura métrica, las metáforas y el ritmo rompen los patrones de seguridad que los modelos aprenden durante su entrenamiento. Es un ataque que no requiere iteraciones ni acceso técnico: basta con un solo mensaje bien escrito.

¿Qué significa esto para tu empresa?

Si tu organización usa asistentes de IA para atención al cliente, análisis de datos o acceso a bases de conocimiento internas, el riesgo es concreto. Un jailbreak exitoso puede exponer información sensible, generar contenido engañoso o incluso servir como punto de entrada para ataques más amplios. El informe de IBM indica que solo el 24 % de los proyectos actuales de IA generativa incluyen un componente de seguridad dedicado.

Para las pymes y empresas latinoamericanas, que muchas veces carecen de un departamento de ciberseguridad, la recomendación es clara: no dejar información sensible accesible para los asistentes de IA si no es estrictamente necesario. Además, establecer protocolos de uso y, donde existan comités de ética o sindicatos, discutir abiertamente qué herramientas se implementan y cómo se protegen los datos.

El jailbreak de IA no es una amenaza teórica. Es un recordatorio de que la seguridad no puede quedar relegada frente a la innovación. Y que, a veces, las palabras más simples, o las más bellas, son las que abren las puertas que creíamos cerradas.

Fuentes

  1. Jailbreaking de la IA: clasificación de riesgos para PYMES
  2. Jailbreak de la IA: erradicar una amenaza en evolución
  3. ¿Puede el ajuste defensivo eliminar las vulnerabilidades de jailbreaking?
  4. Poesía adversaria como mecanismo universal de jailbreak de un solo turno en modelos de lenguaje grandes
Maríté Gil

Escrito por

Maríté Gil

Editora · Gobernanza, IA y regulación en Latinoamérica · Consultora ISO

Marité Gil lleva más de una década construyendo los sistemas que hacen que las organizaciones latinoamericanas funcionen bien, rindan cuentas y no colapsen ante la presión regulatoria. Cofundadora de ISOINNOVA, auditora líder certificada en siete normas ISO, editora de Turing Magazine y directora de Bitz Magazine, escribe sobre inteligencia artificial, regulación y gobernanza porque cree que los marcos bien diseñados no son burocracia, son infraestructura de confianza.