Opinión Diseñar la frontera del caché, no activarla, abarata hasta 80% la inferencia de agentes
Un estudio de PwC revela que la estrategia de fronteras de caché, no su mera activación, reduce hasta 80% el costo de inferencia en agentes de larga duración. Para empresas latinoamericanas que pagan en dólares, diseñar bien esta arquitectura es la diferencia entre piloto y producción.
Los agentes autónomos que investigan, codifican o analizan durante horas comparten una anatomía costosa: cada turno arrastra definiciones de herramientas, instrucciones y contexto previo. Sin mecanismo de reutilización, cada llamada a la API reprocesa lo idéntico. El caché de prompts —la capacidad de los proveedores para reaprovechar tensores clave-valor (KV) de prefijos comunes— se ha convertido en la palanca económica que separa proyectos piloto de sistemas en producción.
Un estudio de PwC evaluado sobre 500 sesiones de agentes con prompts de 10.000 tokens en DeepResearch Bench muestra que el caché reduce costos de API entre 41 % y 80 % y mejora el tiempo al primer token (TTFT) entre 13 % y 31 % según el proveedor. Pero la media oculta la decisión crítica: la estrategia de fronteras de caché importa más que activarla.
Tres proveedores, tres filosofías
OpenAI cachea automáticamente prefijos compartidos dentro de una ventana de 30 minutos y descuenta hasta el 90 % de los tokens de entrada cacheados. Anthropic exige puntos de quiebre explícitos (`cache_control`) definidos por el desarrollador. Google ofrece ambos: caché implícito sin garantía de descuento y objetos de caché explícitos con precios fijos. La investigación de PwC prueba que cachear solo el prompt del sistema —excluyendo resultados de herramientas dinámicos— entrega los beneficios más consistentes en costo y latencia. El caché de contexto completo, paradójicamente, puede aumentar latencia al forzar escrituras de contenido que nunca se reutiliza.
Para un equipo en México, Colombia o Argentina que paga en dólares la inferencia, esta distinción no es académica. Un agente de investigación profunda con 30-50 llamadas de herramientas por sesión acumula decenas de miles de tokens. Cachear definiciones de herramientas estables y mover contenido variable al final del prompt —como recomienda la guía técnica de Idir.ai— puede reducir la factura mensual en dos tercios, como reportó el ingeniero de Wordsmith.
Seguridad: el costo oculto del caché global
Una auditoría de Stanford detectó caché compartido entre usuarios en 7 de 17 proveedores, incluido OpenAI. Si el caché es global, un atacante mide tiempos de respuesta para inferir prefijos de prompts ajenos —fuga de propiedad intelectual o datos sensibles. Al menos cinco proveedores mitigaron la vulnerabilidad tras la divulgación responsable, desactivando el caché cross-organization. Para regulaciones como la LGPD en Brasil o la Ley 25.326 en Argentina, verificar el alcance del caché (por usuario, organización o global) debe ser requisito de procurement, no después-pensamiento.
Más allá del prefijo exacto: GenCache
El caché tradicional exige coincidencia exacta de prefijo. GenCache, presentado en NeurIPS 2025, agrupa prompts estructuralmente similares y sintetiza un programa que genera respuestas adaptadas a la variación. En flujos de trabajo agente (web shopping, SRE, mapas) logra 83 % de aciertos y reduce la latencia de extremo a extremo en un 34 %. No reemplaza el caché de proveedor —opera en capa cliente— pero amplía el universo de reutilización donde los prompts siguen plantillas con variaciones controladas.
Lista de verificación para equipos LatAm
- Auditar qué proveedor y modelo usan los agentes en producción y conocer su política de caché (automática, explícita, híbrida).
- Estructurar prompts con contenido estático al inicio (instrucciones, definiciones de herramientas) y contenido dinámico al final.
- Excluir explícitamente resultados de herramientas del caché cuando el proveedor lo permita.
- Verificar el alcance del caché (usuario, organización, global) y exigir aislamiento cross-org en contratos.
- Evaluar capas de cliente como GenCache para workloads con plantillas recurrentes.
El caché de prompts dejó de ser optimización opcional. Es infraestructura de costos. Quien lo diseña mal paga el mismo contexto una y otra vez; quien lo estructura bien convierte agentes de horizonte largo en operación sostenible.