Un diagrama nacido para una columna de paper hoy tiene que sobrevivir a muchos formatos: una diapositiva 16:9, un póster vertical, un teaser cuadrado para redes y un preview de teléfono 9:16. En cada conversión, el riesgo no es estético sino estructural: una conexión mal colocada tergiversa el método, el proceso o el flujo que el diagrama promete explicar.
Sobre ese problema acaba de aparecer un preprint en arXiv firmado por un equipo de National Yang Ming Chiao Tung University y la University of Illinois Urbana-Champaign. Su propuesta trata la reordenación de diagramas de flujo como una tarea específica: dado un diagrama rasterizado y una proporción objetivo, producir un layout fiel, sin alucinaciones y editable en una herramienta estándar. El resultado no es una imagen regenerada, sino XML compatible con draw.io, listo para seguir ajustándose a mano.
La investigación exhibe los modos de fallo de lo que existe. Los modelos de imagen a imagen estiran los bloques y rechazan formatos extremos. Los sistemas texto a imagen re-sintetizan desde un prompt y terminan eliminando bloques o sumando etiquetas que no estaban en el original. Los sistemas que primero parsean y luego renderizan recuperan los componentes, pero enrutan mal las flechas y rompen el grafo que el diagrama existe para comunicar. Ninguna de esas familias logra a la vez fidelidad estructural, ausencia de alucinación y redimensionado arbitrario.
Tres etapas con un crítico en cada esquina
La solución del preprint divide el flujo en Parse, Style y Layout. Cada etapa combina un agente principal con un crítico que aplica verificaciones deterministas y retroalimentación visual de un modelo de lenguaje multimodal. Así, la conectividad se comprueba de manera explícita en lugar de darse por sentada. Sobre un benchmark de 100 diagramas de flujo evaluados en cinco proporciones, con Gemini 3.1 Pro como juez validado contra juicios humanos, el pipeline alcanza 68.6% de fidelidad de contenido frente al 11.2–41.4% de los métodos previos. Es un preprint bajo revisión, pero la dirección es clara: la próxima frontera de la IA visual no es generar imágenes bonitas, sino preservar significado.
Esa misma obsesión por la integridad aparece en otros trabajos académicos. MapTopics, una tesis de maestría en la Charles University dirigida por Jiří Švancara, construye mapas mentales interactivos y anclados a fuentes con un pipeline de generación conectable, un recomendador híbrido que combina similitud léxica y semántica con señales colaborativas, un paso de layout evolutivo y un sistema de recuperación aumentada para que el mapa no flote en el vacío.
Su decisión de diseño más relevante para América Latina es que toda la aplicación corre offline contra un modelo de lenguaje local pequeño: evita la latencia y el costo de la inferencia alojada y mantiene los datos en el dispositivo. En una región donde la conexión y el acceso a APIs pagas no son uniformes, esa arquitectura local-first no es un lujo, es una condición de adopción.
En otra disertación reciente, Mediating Complexity, de la University of Maryland, se aborda cómo las capas de razonamiento van de la interacción corpórea hasta los sistemas de agentes. El campo empieza a tratar los pipelines agénticos no como trucos de generación, sino como un nivel nuevo de mediación entre la intención humana y la representación visual. La coincidencia no es casual: la pregunta ya no es qué tan rápido produce una imagen una máquina, sino cuánto de la intención original sobrevive al proceso.
Open source, nube y el equilibrio latinoamericano
El mercado ya refleja esas tensiones. Lucidchart permite describir un proceso en lenguaje conversacional o adjuntar un archivo para que Lucid AI cree, diseñe y optimice el diagrama al instante; ofrece más de mil plantillas, integraciones con Google, Microsoft, Slack y Zoom, y en su propia página aparecen clientes con operación regional como Claro, LATAM Airlines, Sura y GNP Seguros.
En el extremo opuesto, la oferta de código abierto sigue siendo una opción viable. El precio a pagar, en general, es la falta de colaboración en tiempo real y de automatización integrada. Para startups y equipos pequeños de la región, la ausencia de licencias costosas sigue pesando más que las funciones avanzadas.
Para una empresa latinoamericana, la decisión entre una plataforma SaaS y una herramienta autogestionada no es solo presupuestaria. Los diagramas de proceso suelen contener información sensible: flujos de aprobación, datos de clientes, rutas operativas. Cuando las normas de protección de datos en la región se endurecen, correr la generación completa en la nube no siempre es la opción natural. Un modelo local, un formato abierto y un XML editable son también una forma de control que reduce la dependencia de proveedores externos y de divisas.
El punto no es si la IA puede dibujar un diagrama, sino si puede reordenarlo sin mentir. En un proceso regulado, una flecha mal enrutada puede convertir un mapa de flujo en una fuente de incumplimiento. Las herramientas que sobrevivan serán las que hagan de la verificación una parte del diseño, no una ocurrencia. ¿Sabe su equipo si el diagrama que le muestra la IA sigue siendo el proceso que realmente ocurre?