El 54% de consultas usa modelos sobredimensionados y eleva costos 44%

Empresas latinoamericanas adoptan IA sin gobernanza de costos: 1 de 3 supera presupuesto de tokens y solo 7% aplica chargeback interno. Accenture estima que modelo routing y accountability podrían frenar 44% del alza proyectada.

El 54% de consultas usa modelos sobredimensionados y eleva costos 44%

Foto: Smartworks Coworking

Las empresas están adoptando inteligencia artificial más rápido de lo que tardan en aprender a gestionar su economía. El patrón se repite en Tokio, Seattle y también en São Paulo o Ciudad de México: los precios por token caen —98 % desde finales de 2022 para rendimiento nivel GPT-4— pero el gasto empresarial se dispara, 320 % en el mismo período según datos de mercado que recoge Fluid Attacks. El presupuesto promedio pasó de 1,2 a 7 millones de dólares. En Latam, donde los presupuestos se cotizan en moneda local y la volatilidad cambiaria castiga cada factura en dólares, el descontrol no es una molestia contable: es un riesgo de continuidad.

El diagnóstico: sobredimensionamiento sistemático y contabilidad invisible

La encuesta de Accenture a 750 ejecutivos de 17 países —incluyendo Japón— revela la magnitud del desajuste. Las compañías destinan de media el 25 % de su presupuesto de IA a tokens, y la mitad de los encuestados sitúa el consumo de tokens entre los tres principales impulsores de costos. Una de cada tres organizaciones ya superó su presupuesto anual de tokens, y los directivos prevén un aumento del 78 % en el consumo durante los próximos dos años.

Patrocinado Advertisement

El hallazgo más contundente no es el volumen, sino la ineficiencia: el 54 % de las peticiones a modelos de IA utilizan capacidades superiores a las que la tarea requiere. Accenture analizó 9.368 tareas laborales mediante la base O*NET del Departamento de Trabajo de EE. UU. y estimó que solo el 10 % exige realmente modelos frontera. El resto —clasificación, extracción, resumen, formateo— se resuelve con modelos más pequeños y baratos.

Esa brecha entre lo que se necesita y lo que se usa explica por qué la caída de precios no alivia la factura. Cuando el costo por token baja 25 % o más, el 95 % de los ejecutivos encuestados dice que aumentará el gasto total en IA en lugar de ahorrar la diferencia. Es el paradigma de Jevons aplicado a la inferencia: eficiencia genera más consumo, no menos factura.

Gobernanza ausente: quién paga, quién decide, quién mide

Esa falta de visibilidad agrava el problema. Menos del 20 % del gasto en tokens puede vincularse cuantitativamente a resultados financieros. Incluso en el caso de uso más estratégico, solo el 35 % de las empresas sabe calcular su costo por resultado.

Los mecanismos de rendición de cuentas son casi inexistentes: apenas el 7 % aplica chargeback —repercusión de costos al departamento que consume—. El 37 % cuenta con un equipo dedicado a gestionar gasto en tokens; en el 48 % restante la responsabilidad se reparte difusamente entre TI y finanzas. Sin propiedad clara, no hay incentivo para optimizar.

Accenture agrupa estas prácticas bajo el concepto de tokenomics: tratar el token como recurso escaso y gobernable, no como detalle técnico invisible. Su modelo propone tres palancas:

  • Model routing: enrutar cada petición al modelo mínimo viable. Complejidad alta → modelo frontera; tareas rutinarias → modelo ligero. Los directivos lo consideran la medida más importante, pero solo el 30% lo ha implementado.
  • Accountability por caso de uso: antes de aprobar un proyecto, definir responsable, modelo asignado, costo estimado y métrica de éxito.
  • Chargeback y visibilidad: que cada área vea en su P&L el costo real de sus llamadas a IA.

Según la consultora, aplicar este marco con rigor podría contener hasta el 44 % del aumento de costos proyectado a dos años.

Palancas técnicas que ya funcionan

Más allá de la gobernanza, la ingeniería de plataforma ofrece alivio inmediato. Google reporta que combinar Gemini 3.5 Flash con modelos frontera reduce drásticamente el gasto sin merma perceptible en muchos casos. ManpowerGroup pasó de 10 a 4 iteraciones de prompt por consulta optimizando la ingeniería de prompts, recortando tokens proporcionalmente.

DevRev y NetBrain insertan capas de caché y cómputo tradicional entre los agentes y los sistemas de registro (Salesforce, ERP, service mesh), de modo que solo la porción estrictamente necesaria llega al LLM. Nvidia y Microsoft apuestan por inferencia local: el PC RTX Spark ejecuta modelos de 120.000 millones de parámetros en el escritorio, eliminando la factura por token en cargas de trabajo sensibles a latencia o privacidad.

El ángulo latinoamericano: moneda, talento y soberanía

En la región, el problema tiene aristas propias. La factura de tokens se paga en dólares; una devaluación de 20 % multiplica el overrun sin que la organización haya cambiado una línea de código. Los equipos de ingeniería son más pequeños y costosos de retener; dedicar headcount a prompt engineering o model routing compite con la entrega de producto. Y la soberanía de datos —regulaciones en Brasil, Colombia, México— empuja a mantener ciertos workloads on-premise o en nubes locales, donde la inferencia local (RTX Spark, vLLM en GPU propias) deja de ser experimento para ser requisito de cumplimiento.

Fundación Linux ya avanza en la Tokenomics Foundation para estandarizar métricas y benchmarks de costo-eficiencia, igual que FinOps hizo con el cloud. En Latam, donde FinOps llegó tarde y a medias, la ventana para adoptar tokenomics antes de que la deuda técnica sea inmanejable se cierra rápido.

Hacia precios por resultado, no por fragmento de texto

Gartner anticipa el paso de token-based pricing a outcome-based pricing: pagar por ticket resuelto, por documento clasificado, por código mergeado. Algunas proveedoras ya pilotan ese modelo. Para el CIO latinoamericano, la señal es clara: quien no sepa hoy cuántos tokens consume cada caso de uso y cuánto vale ese resultado, no podrá negociar mañana un contrato por outcomes.

Esta carrera no es por el modelo más grande, sino por la arquitectura que asigne el modelo justo a cada tarea, mida el retorno y haga visible el costo en el centro de decisión correcto. El 44 % de ahorro potencial no es una proyección teórica: es el costo de no tener gobernanza hoy.

Fuentes

  1. Posibilidad de reducir en un 44 % el aumento de costes de tokens de IA: ¿cómo frenar el «uso excesivo» de modelos de alto rendimiento?
  2. MÉTODOS DE BAJO CONSUMO DE TOKENS EN MODELOS DE LENGUAJE GRANDES: UNA REVISIÓN EXHAUSTIVA DE TÉCNICAS DE EFICIENCIA, MARCOS …
  3. Economía de tokens de IA y control de costos | Fluid Attacks
  4. Accenture sella un acuerdo con Anthropic para evaluar el desarrollo de sus modelos de inteligencia artificial
  5. La carrera por abaratar la IA: así intentan las empresas bajar ... - CIO
Valmis Di Carlo

Escrito por

Valmis Di Carlo

Especialista en infraestructura

Especialista en administración de sistemas UNIX/Linux, ciberseguridad e infraestructura tecnológica, con experiencia en consultoría TI, investigación computacional y operación de entornos críticos. Desde DICATECH, SRL, combina dominio técnico en OpenBSD, FreeBSD, Solaris y GNU/Linux con una mirada práctica sobre seguridad, continuidad y arquitectura de servicios, ayudando a organizaciones a construir plataformas más estables, seguras, auditables, escalables y resilientes.