Un director creativo en Bogotá recibe un brief: campaña navideña para un retail, 50 piezas en tres días. Su equipo abre Photoshop, Illustrator, InDesign. Cada pieza exige docenas de decisiones encadenadas —máscaras, tipografía, jerarquía visual, coherencia de marca— donde un error en el paso tres arrastra al veinte. La IA generativa promete acelerar esto, pero falla donde más duele: no hay test unitario que valide "buen diseño". El juicio es subjetivo, ruidoso, dependiente de contexto.
Los caminos tradicionales chocan contra la realidad latinoamericana. Reentrenar un modelo pide GPUs que no hay, pesos que no se entregan, presupuesto de cómputo que no cabe. El prompt engineering es frágil: no transfiere entre herramientas, no aprende de sus errores, no compone mejoras ronda a ronda. Los bucles de autorreflexión funcionan en código —donde los tests dicen sí o no— pero se desmoronan cuando el juez es un modelo de visión con sesgos documentados de posición y orden.
Investigadores de Adobe y la Universidad Brown presentan una tercera vía: Designer-RSI. La idea es tan simple que parece obvia a posteriori: congelar el modelo fundacional y dejar que aprenda una memoria procedimental externa. Los pesos no cambian. Las herramientas —más de 230 operaciones reales equivalentes a la suite de Adobe— no cambian. Lo que evoluciona es una colección curada de playbooks en lenguaje natural (archivos SKILL.md) que el agente recupera y sigue en tiempo de ejecución.
Arquitectura: modelo congelado, herramientas reales, memoria viva
Como agente base actúa un modelo frontier (Claude Sonnet 4, Opus 4.6 o Qwen 3.6-27B). Recibe el brief, recupera skills relevantes, selecciona el subconjunto de herramientas y ejecuta la cadena hasta renderizar la imagen final. Cada skill está entre una llamada atómica y una trayectoria completa: lo bastante específica para guiar, lo bastante general para transferir entre briefs.
El bucle offline tiene cuatro roles: un Prompter que plantea briefs (tráfico real o variantes sintéticas), un Solver (el agente), un Grader multimodal que puntúa y explica fallos, y un Reflector que convierte esos fallos en ediciones dirigidas de los SKILL.md. Solo cambian los skills; todo lo demás permanece fijo.
Dos mecanismos operan en paralelo. El ensanchamiento descubre skills que faltan: subtareas recurrentes que la biblioteca actual no cubre. Cuando una etiqueta canónica alcanza tres ocurrencias, se destila una skill candidata. El umbral de tres no es arbitrario: una skill nacida de un solo fallo podría ser artefacto; exigir tres asegura que el hueco sea sistémico. La profundización endurece skills que fallan repetidamente. El Reflector recibe el brief, los racionales de fallo, el skill actual y un conjunto contrastivo de ejecuciones exitosas de ese mismo skill —secuencias de herramientas, waypoints intermedios, tokens de razonamiento que funcionaron—. Razona sobre una divergencia concreta éxito-fallo, no solo sobre texto de error.
La puerta de replay: admisión conservadora bajo ruido
Tanto ensanchamiento como profundización proponen cambios; una única puerta decide cuáles se despliegan. Ataca dos fuentes de confusión: la deriva del juez VLM (la misma imagen puntúa distinto entre corridas) y la variabilidad upstream (assets y estado distinto entre brazos). Recurre a matched replay: para cada cambio, muestrea prompts, genera varios contextos por prompt con assets y estado distintos, congela cada contexto y re-ejecuta en lote bajo ambos brazos. Las salidas se juzgan pairwise con aleatorización de orden.
Solo se despliega un cambio si no pierde ningún prompt y gana al menos uno. Criterio asimétrico: fácil de rechazar (cualquier regresión lo mata), difícil de aceptar (debe ganar sin perder nunca). Refleja la realidad operativa: las regresiones en producción son mucho más costosas que mejoras perdidas.
Resultados: la combinación supera a cada parte por separado
Sobre 1.406 briefs no solapados corrieron cinco rondas, produciendo 1.869 trayectorias sin etiquetas humanas. El banco creció de 76 skills semilla (destiladas de documentación interna) a 139. Ronda 1 dominada por reparación; rondas 2-3 pico de acuñación; ronda 4 expande cobertura pero cae en fiabilidad baja; ronda 5 invierte la mezcla: 21 reescrituras y solo 4 acuñaciones, la ronda más fuerte en todo umbral.
En benchmark interno (200 briefs held-out), respecto a sin skills, ronda 5 eleva completitud ≥0.5 de 86% a 93%, ≥0.9 de 43% a 56%, exactamente 1.0 de 24% a 32%. La mayor mejora: +13 puntos porcentuales en el umbral 0.9. En benchmarks generales: GenEval2 salta de 72.7% a 99.3% en Sonnet-4; DPG-Bench de 82.7% a 100%. En diseño gráfico juzgado pairwise por GPT-5.4: win rate global 61.8% y 67.6% contra agente sin skills.
El estudio de ablación lo confirma: ensanchamiento solo 49,4%, profundización sola 48,6%, combinación 58,5% (p=0,025). La ganancia superaditiva refleja acoplamiento del bucle: skills acuñadas requieren descripciones de recuperación refinadas; reescribir reencamina fallos inarreglables al pool de huecos para futura acuñación.
Latencia y costo: overhead controlado
La recuperación añade ~28% tokens de prompt sobre el agente base. Pero la evolución no añade costo marginal. Con top-k (k=3), Evolve usa menos tokens de prompt y salida que el cold-start (436,6k/5167 vs 445,2k/5298), consistente con ejecución más directa y menos reintentos. Overhead medio de latencia wall-clock: 3,4% a 6,2%; en DPG-Bench Sonnet-4 baja de 113 a 82 segundos porque el agente guiado comete menos errores.
Límites declarados
Los autores son francos: una skill en lenguaje natural no garantiza que el modelo la siga cuando tiene una estrategia por defecto fuerte. Operaciones geométricas finas (alineación sub-píxel, grading colorimétrico exacto) son duras para evaluadores VLM. Procedimientos largos pierden fidelidad: 30 pasos es más difícil que 5. La puerta de replay es local a casos evaluados: no garantiza mejora monótona sobre toda la distribución. Cold-start: el banco semilla vino de documentación, no de tráfico; si la documentación es incompleta, las primeras rondas son lentas.
Qué significa para empresas en Latinoamérica
Para agencias, equipos de marketing, e-commerce, medios: la memoria procedimental es alternativa viable al fine-tuning para adaptación continua, especialmente cuando no se pueden o quieren actualizar pesos.
Tres factores la hacen relevante:
1. Funciona con APIs hospedadas. No hace falta clúster de GPUs, ni acceso a pesos, ni pipeline de MLOps. El modelo sigue siendo una llamada a Anthropic, OpenAI o proveedores locales; la capa que aprende vive en tu infraestructura, versionada en Git, auditable, portable. 2. Cero etiquetas humanas. El bucle usa tráfico real y grader automático. Donde etiquetar datos de diseño es caro y subjetivo, reduce la barrera drásticamente. 3. Composición de *expertise* local. El banco semilla parte de guías de marca, plantillas aprobadas. El ensanchamiento captura patrones recurrentes de tus clientes; la profundización endurece flujos que tu equipo ya usa. El conocimiento de diseño de tu organización se codifica en skills, no en pesos opacos.
Costo operativo predecible: overhead de latencia bajo, tokens netos menores por ejecución eficiente, ciclo de evolución nocturno sobre el tráfico del día. Para equipos que ya pagan Creative Cloud y APIs, la capa de memoria procedimental es inversión de ingeniería —no de investigación— con retorno medible en completitud de briefs y reducción de re-trabajo.
Advierte la operación: la puerta de replay es tan buena como el grader. Si tu evaluador no captura criterios de marca sutiles, la puerta dejará pasar skills que "ganan" en métrica pero fallan en juicio humano. Un grillete humano en el loop de admisión (revisar skills candidatas antes de merge) mitiga el riesgo sin romper la automatización.
No resuelve el diseño generativo de un shot. Resuelve la adaptación incremental de un agente que ya sabe operar herramientas profesionales. Para la mayoría de equipos en LatAm que no entrenan modelos propios, ese es el problema correcto.