Opinión Filtros de seguridad de la IA fallan y abren la puerta a abusos
Los mecanismos de rechazo en modelos de IA fallan y crean nuevos daños: desde armas biológicas hasta daño psicológico en usuarios vulnerables. Gobiernos y empresas dibujan líneas rojas opacas mientras la doble utilidad de la tecnología escapa a todo control.
La industria ha vendido una promesa tranquilizadora: los modelos de lenguaje saben decir que no. Si pides instrucciones para fabricar un patógeno o coordinar un enjambre de drones autónomos, el sistema se niega. Pero esa red de contención tiene agujeros que no son teóricos. Investigadores de OpenAI y Anthropic han documentado decenas de miles de intentos de abuso por agentes descontrolados en los últimos meses. La negativa falla, y cuando lo hace, la factura puede ser una calamidad global.
El problema no es solo técnico. Cada vez que un modelo rechaza una solicitud, alguien —ingenieros, comités de seguridad, eventualmente reguladores— ha trazado una frontera entre lo permisible y lo prohibido. Esa línea es política por definición. Gobiernos de todo el mundo están exigiendo sus propias listas de negativas obligatorias: contenido político sensible, narrativas históricas incómodas, críticas al poder. La herramienta diseñada para evitar el daño se convierte en instrumento de control del discurso. En América Latina, donde la regulación digital avanza a velocidades dispares, el riesgo es que se importen criterios de censura disfrazados de seguridad sin debate público ni salvaguardas democráticas.
La tensión se agrava por la naturaleza de doble uso de la tecnología. La misma pericia genética que permite diseñar terapias contra el cáncer facilita la creación de armas biológicas. La capacidad de escribir código seguro también sirve para descubrir vulnerabilidades de día cero. No se puede tener la utilidad sin el peligro; el conocimiento es indivisible. Apostar todo a la negativa es apostar a que un filtro —por sofisticado que sea— contenga la totalidad del conocimiento humano peligroso. Es una apuesta perdida de antemano.
Pero hay una dimensión invisible que apenas empieza a estudiarse. Un artículo reciente en arXiv introduce el concepto de "Daño Secundario por Negativa Abrupta" (ARSH). Cuando un usuario en crisis emocional conversa con un chatbot y los protocolos de seguridad cortan la interacción de golpe —"No puedo continuar", "Llame al 988"—, la ruptura puede profundizar el aislamiento, la vergüenza y la desesperanza. El sistema, diseñado para proteger la vida, inflige un daño iatrogénico: el remedio se vuelve veneno. Los autores proponen un "Estándar de Finalización Compasiva" que reemplace el corte seco por una transición guiada, empática y transparente. La lección es clara: la forma de la negativa importa tanto como su existencia.
Para los directivos que adoptan IA en sus organizaciones, la lectura es incómoda. No basta con activar los "guardrails" del proveedor y asumir que el riesgo está gestionado. Hay que preguntarse: ¿qué sucede cuando el modelo se niega a analizar un contrato por contener cláusulas sensibles? ¿Qué pasa cuando rechaza una simulación de crisis financiera por parecer "instrucción para actividad ilegal"? La sobre-negativa (over-refusal) ya es un problema documentado: modelos que declinan tareas legítimas por exceso de cautela, erosionando la productividad y la confianza.
La salida no es eliminar los controles, sino dejar de tratarlos como una solución completa. Se necesita una arquitectura de defensa en capas: evaluación continua de capacidades peligrosas (no solo de negativas), auditoría externa de las listas de rechazo, transparencia sobre quién decide qué se prohíbe y mecanismos de apelación y revisión humana. En el plano psicológico, adoptar estándares de finalización compasiva en cualquier interfaz conversacional que atienda a personas. En el plano geopolítico, exigir que los marcos regulatorios latinoamericanos definan sus propias líneas rojas mediante procesos legislativos abiertos, no por imposición de términos de servicio de plataformas extranjeras.
La negativa de la IA se ha convertido en el sustituto barato de una gobernanza real. Mientras los modelos sigan siendo cajas negras entrenadas para decir que no sin rendir cuentas de sus errores, cada fallo será una apuesta a ciegas. La próxima calamidad no vendrá porque la IA haya dicho que sí, sino porque todos creímos que su "no" era infalible.