El espejismo de la eficiencia barata
Los precios por token se desplomaron 98 % desde 2022, pero el gasto empresarial en IA se disparó 320 % en el mismo periodo, según datos de Fluid Attacks. El presupuesto promedio saltó de 1,2 a 7 millones de dólares. En América Latina, donde la factura llega en dólares y la moneda local fluctúa, esa brecha no es un problema contable: es un riesgo de continuidad operativa.
El diagnóstico: sobredimensionamiento sistemático
Una encuesta de Accenture a 750 ejecutivos en 17 países revela que el 54 % de las peticiones a modelos de IA consumen capacidades superiores a lo que la tarea requiere. Solo el 10 % de las 9.368 tareas laborales analizadas bajo la base O*NET exige realmente modelos frontera. El resto —clasificación, extracción, resumen— se resuelve con modelos menores y más baratos.
Cuando el costo por token cae 25 % o más, el 95 % de los directivos encuestados aumenta el gasto total en lugar de capturar el ahorro. Es la paradoja de Jevons aplicada a la inferencia: la eficiencia genera más consumo, no menos factura. Una de cada tres organizaciones ya superó su presupuesto anual de tokens y los directivos prevén un alza del 78 % en el consumo a dos años.
La gobernanza ausente
Menos del 20 % del gasto en tokens puede vincularse cuantitativamente a resultados financieros. Apenas el 7 % aplica chargeback —repercusión de costos al centro de consumo—. En el 48 % de los casos la responsabilidad se reparte difusamente entre TI y finanzas. Sin propiedad clara, no hay incentivo para optimizar.
Accenture agrupa la solución bajo el concepto de tokenomics: tratar el token como recurso escaso y gobernable. Su modelo de tres palancas podría contener el aumento de costos proyectado.
Palancas técnicas que ya funcionan
La ingeniería de plataforma ofrece alivio inmediato. Google reporta que combinar Gemini 3.5 Flash con modelos frontera reduce drásticamente el gasto sin merma perceptible. ManpowerGroup pasó de 10 a 4 iteraciones de prompt por consulta optimizando la ingeniería, recortando tokens proporcionalmente. DevRev y NetBrain insertan capas de caché y cómputo tradicional entre agentes y sistemas de registro (Salesforce, ERP), de modo que solo lo estrictamente necesario llega al LLM. Nvidia y Microsoft apuestan por inferencia local: el PC RTX Spark ejecuta modelos de 120.000 millones de parámetros en el escritorio, eliminando la factura por token en cargas sensibles a latencia o privacidad.
El ángulo latinoamericano: moneda, talento y soberanía
En la región el problema tiene aristas propias. Una devaluación del 20 % multiplica el overrun sin que la organización cambie una línea de código. Los equipos de ingeniería son más pequeños y costosos de retener; dedicar headcount a prompt engineering o model routing compite con la entrega de producto. La soberanía de datos —regulaciones en Brasil, Colombia, México— empuja a mantener ciertos workloads on-premise o en nubes locales, donde la inferencia local (RTX Spark, vLLM en GPU propias) deja de ser experimento para ser requisito de cumplimiento.
Tokenomics Foundation, de Linux Foundation, avanza en estandarizar métricas de costo-eficiencia, igual que FinOps hizo con la nube. En Latam, donde FinOps llegó tarde y a medias, la ventana para adoptar tokenomics antes de que la deuda técnica sea inmanejable se cierra rápido.
Hacia precios por resultado, no por fragmento
Gartner anticipa el paso de token-based pricing a outcome-based pricing: pagar por ticket resuelto, documento clasificado o código mergeado. Para el CIO latinoamericano, la señal es clara: quien no sepa hoy cuántos tokens consume cada caso de uso y cuánto vale ese resultado, no podrá negociar mañana un contrato por outcomes.
Esta carrera no es por el modelo más grande, sino por la arquitectura que asigne el modelo justo a cada tarea, mida el retorno y haga visible el costo en el centro de decisión correcto. El 44 % de ahorro potencial no es una proyección teórica: es el costo de no tener gobernanza hoy.