Radar PwC revela que la frontera de caché fija el costo de agentes en LatAm
La investigación revela que el control estratégico de fronteras de caché —no el caché automático— determina la economía de agentes de larga duración. Para empresas latinoamericanas, la elección de proveedor y arquitectura de prompts impacta directo en el presupuesto de inferencia.
Los agentes autónomos que investigan, codifican o analizan durante horas comparten un patrón: cada turno arrastra definiciones de herramientas, instrucciones y contexto previo. Sin mecanismo de reutilización, cada llamada a la API reprocesa lo idéntico. El caché de prompts —la capacidad de los proveedores para reaprovechar tensores clave-valor (KV) de prefijos comunes— se ha convertido en la palanca económica que separa proyectos piloto de sistemas en producción.
Un estudio de PwC evaluado sobre 500 sesiones de agentes con prompts de 10.000 tokens en DeepResearch Bench muestra que el caché reduce costos de API entre 41 % y 80 % y mejora el tiempo al primer token (TTFT) entre 13 % y 31 % según el proveedor Don't Break the Cache. Pero la media oculta la decisión crítica: la estrategia de fronteras de caché importa más que activarla.
Tres proveedores, tres filosofías
OpenAI cachea automáticamente prefijos compartidos dentro de una ventana de 30 minutos y descuenta hasta 90 % los tokens de entrada cacheados OpenAI. Anthropic exige puntos de quiebre explícitos (`cache_control`) definidos por el desarrollador. Google ofrece ambos: caché implícito sin garantía de descuento y objetos de caché explícitos con precios fijos. La investigación de PwC prueba que cachear solo el prompt del sistema —excluyendo resultados de herramientas dinámicos— entrega los beneficios más consistentes en costo y latencia. El caché de contexto completo, paradójicamente, puede aumentar latencia al forzar escrituras de contenido que nunca se reutiliza.
Para un equipo en México, Colombia o Argentina que paga en dólares la inferencia, esta distinción no es académica. Un agente de investigación profunda con 30-50 llamadas de herramientas por sesión acumula decenas de miles de tokens. Cachear definiciones de herramientas estables y mover contenido variable al final del prompt —como recomienda la guía técnica de Idir.ai Idir.ai— puede reducir la factura mensual en dos tercios, como reportó el ingeniero de Wordsmith OpenAI.
Seguridad: el costo oculto del caché global
Una auditoría de Stanford detectó caché compartido entre usuarios en 7 de 17 proveedores, incluido OpenAI Auditing Prompt Caching. Si el caché es global, un atacante mide tiempos de respuesta para inferir prefijos de prompts ajenos —fuga de propiedad intelectual o datos sensibles. Al menos cinco proveedores mitigaron la vulnerabilidad tras la divulgación responsable, desactivando el caché cross-organization. Para regulaciones como la LGPD en Brasil o la Ley 25.326 en Argentina, verificar el alcance del caché (por usuario, organización o global) debe ser requisito de procurement, no después-pensamiento.
Más allá del prefijo exacto: GenCache
El caché tradicional exige coincidencia exacta de prefijo. GenCache, presentado en NeurIPS 2025, agrupa prompts estructuralmente similares y sintetiza un programa que genera respuestas adaptadas a la variación GenCache. En flujos de trabajo agente (web shopping, SRE, mapas) logra 83 % de aciertos y reduce latencia de extremo a extremo 34 %. No reemplaza el caché de proveedor —opera en capa cliente— pero amplía el universo de reutilización donde los prompts siguen plantillas con variaciones controladas.
Lista de verificación para equipos LatAm
- Mapear qué es estático: instrucciones del sistema, definiciones de herramientas, documentos de referencia. Eso va al prefijo cacheable.
- Aislar lo dinámico: IDs de sesión, timestamps, resultados de herramientas, preguntas del usuario. Eso va al sufijo.
- Elegir proveedor según control: si necesitas puntos de quiebre explícitos y TTL configurables, Anthropic; si prefieres automatismo con dashboard de diagnóstico, OpenAI; si requieres objetos de caché persistentes con precio garantizado, Google.
- Auditar alcance de caché: preguntar al proveedor si el caché es por usuario, organización o global. Exigir documentación.
- Medir en producción: usar dashboards de aciertos (OpenAI) o logs de `cache_read`/`cache_write` (Anthropic) para validar que la arquitectura de prompts entrega los porcentajes teóricos.
El caché de prompts dejó de ser optimización opcional. Es infraestructura de costos. Quien lo diseña mal paga el mismo contexto una y otra vez; quien lo estructura bien convierte agentes de horizonte largo en operación sostenible.