Las empresas están adoptando inteligencia artificial más rápido de lo que tardan en aprender a gestionar su economía. El patrón se repite en Tokio, Seattle y también en São Paulo o Ciudad de México: los precios por token caen —98 % desde finales de 2022 para rendimiento nivel GPT-4— pero el gasto empresarial se dispara, 320 % en el mismo período según datos de mercado que recoge Fluid Attacks. El presupuesto promedio pasó de 1,2 a 7 millones de dólares. En Latam, donde los presupuestos se cotizan en moneda local y la volatilidad cambiaria castiga cada factura en dólares, el descontrol no es una molestia contable: es un riesgo de continuidad.
El diagnóstico: sobredimensionamiento sistemático y contabilidad invisible
La encuesta de Accenture a 750 ejecutivos de 17 países —incluyendo Japón— revela la magnitud del desajuste. Las compañías destinan de media el 25 % de su presupuesto de IA a tokens, y la mitad de los encuestados sitúa el consumo de tokens entre los tres principales impulsores de costos. Una de cada tres organizaciones ya superó su presupuesto anual de tokens, y los directivos prevén un aumento del 78 % en el consumo durante los próximos dos años.
El hallazgo más contundente no es el volumen, sino la ineficiencia: el 54 % de las peticiones a modelos de IA utilizan capacidades superiores a las que la tarea requiere. Accenture analizó 9.368 tareas laborales mediante la base O*NET del Departamento de Trabajo de EE. UU. y estimó que solo el 10 % exige realmente modelos frontera. El resto —clasificación, extracción, resumen, formateo— se resuelve con modelos más pequeños y baratos.
Esa brecha entre lo que se necesita y lo que se usa explica por qué la caída de precios no alivia la factura. Cuando el costo por token baja 25 % o más, el 95 % de los ejecutivos encuestados dice que aumentará el gasto total en IA en lugar de ahorrar la diferencia. Es el paradigma de Jevons aplicado a la inferencia: eficiencia genera más consumo, no menos factura.
Gobernanza ausente: quién paga, quién decide, quién mide
Esa falta de visibilidad agrava el problema. Menos del 20 % del gasto en tokens puede vincularse cuantitativamente a resultados financieros. Incluso en el caso de uso más estratégico, solo el 35 % de las empresas sabe calcular su costo por resultado.
Los mecanismos de rendición de cuentas son casi inexistentes: apenas el 7 % aplica chargeback —repercusión de costos al departamento que consume—. El 37 % cuenta con un equipo dedicado a gestionar gasto en tokens; en el 48 % restante la responsabilidad se reparte difusamente entre TI y finanzas. Sin propiedad clara, no hay incentivo para optimizar.
Accenture agrupa estas prácticas bajo el concepto de tokenomics: tratar el token como recurso escaso y gobernable, no como detalle técnico invisible. Su modelo propone tres palancas:
- Model routing: enrutar cada petición al modelo mínimo viable. Complejidad alta → modelo frontera; tareas rutinarias → modelo ligero. Los directivos lo consideran la medida más importante, pero solo el 30% lo ha implementado.
- Accountability por caso de uso: antes de aprobar un proyecto, definir responsable, modelo asignado, costo estimado y métrica de éxito.
- Chargeback y visibilidad: que cada área vea en su P&L el costo real de sus llamadas a IA.
Según la consultora, aplicar este marco con rigor podría contener hasta el 44 % del aumento de costos proyectado a dos años.
Palancas técnicas que ya funcionan
Más allá de la gobernanza, la ingeniería de plataforma ofrece alivio inmediato. Google reporta que combinar Gemini 3.5 Flash con modelos frontera reduce drásticamente el gasto sin merma perceptible en muchos casos. ManpowerGroup pasó de 10 a 4 iteraciones de prompt por consulta optimizando la ingeniería de prompts, recortando tokens proporcionalmente.
DevRev y NetBrain insertan capas de caché y cómputo tradicional entre los agentes y los sistemas de registro (Salesforce, ERP, service mesh), de modo que solo la porción estrictamente necesaria llega al LLM. Nvidia y Microsoft apuestan por inferencia local: el PC RTX Spark ejecuta modelos de 120.000 millones de parámetros en el escritorio, eliminando la factura por token en cargas de trabajo sensibles a latencia o privacidad.
El ángulo latinoamericano: moneda, talento y soberanía
En la región, el problema tiene aristas propias. La factura de tokens se paga en dólares; una devaluación de 20 % multiplica el overrun sin que la organización haya cambiado una línea de código. Los equipos de ingeniería son más pequeños y costosos de retener; dedicar headcount a prompt engineering o model routing compite con la entrega de producto. Y la soberanía de datos —regulaciones en Brasil, Colombia, México— empuja a mantener ciertos workloads on-premise o en nubes locales, donde la inferencia local (RTX Spark, vLLM en GPU propias) deja de ser experimento para ser requisito de cumplimiento.
Fundación Linux ya avanza en la Tokenomics Foundation para estandarizar métricas y benchmarks de costo-eficiencia, igual que FinOps hizo con el cloud. En Latam, donde FinOps llegó tarde y a medias, la ventana para adoptar tokenomics antes de que la deuda técnica sea inmanejable se cierra rápido.
Hacia precios por resultado, no por fragmento de texto
Gartner anticipa el paso de token-based pricing a outcome-based pricing: pagar por ticket resuelto, por documento clasificado, por código mergeado. Algunas proveedoras ya pilotan ese modelo. Para el CIO latinoamericano, la señal es clara: quien no sepa hoy cuántos tokens consume cada caso de uso y cuánto vale ese resultado, no podrá negociar mañana un contrato por outcomes.
Esta carrera no es por el modelo más grande, sino por la arquitectura que asigne el modelo justo a cada tarea, mida el retorno y haga visible el costo en el centro de decisión correcto. El 44 % de ahorro potencial no es una proyección teórica: es el costo de no tener gobernanza hoy.