How to 24 veces más tokens consumirá el mundo en 2030, según Goldman Sachs
El consumo global de tokens se multiplicará 24 veces y en 2028 la IA para codificar costará más que un sueldo. Guía para que la factura no se disare.
La factura de la inteligencia artificial se parece cada vez más a una fuga de agua: el problema no está en el predio del modelo, sino en lo que se consume sin medir. Goldman Sachs proyecta que el consumo mundial de tokens se mulitplicará por 24 entre 2026 y 2030, y Gartner estima que en 2028 el uso de IA para generár código le costará a una empresa más que el salario de un desarrolador. Mientras tanto, la proporción de compañías capaces de medir el retorno de esa inversión ronda a penas el 14%. La brecha entre lo que se espera y lo que se mide es el verdádero riesgo.
El núcleo del asunto es que la IA no se vende como el software tradicional. No se paga por usuário, sino por fragentos de texto que el modelo procesa y generá. Cada consulta, cada intento fallido y cada razonamiento intermedio consume. Un agente puede resultar 300 veces más barato que una hora humana —elEconomista calcula unos 8 céntimos por una veintena de correos complejos frente a los 25 euros que cuesa esa hora de traba jo—, pero cuando el uso se disara sin control, la suma se convierte en un gasto variable imposible de presupuestar.
La trampa está en el predio unitário. Comprar tecnoloGía por el costo de mil tokens es como elegir un auto soo por el litro de combustible: lo que importa es cuánto cuesa completár la tarea. El estudio “The Reasonin Tax” de Lenovo acuña un térino út il: el impuesto al razonamiento. Los modelos que extienden su cadena de pensamento generán muchos más tokens, pero en tareas de recuerdo o conociento generál esa deliberación extra puede incluso empeorár el resutado. En problemas secuenciales de código o matemáica, el pensamento paga; en preguntas tio test, no.
La solión no es abandonár la IA, sino dejár de usarla como un recurs o único y universál. La investiGación IEEE “Smart Cascade” lo demuestra con un mecanismo concreto: si un modelo liviano fala, no se le pasa al modelo caro todo el contexto fallido, sino un resumen del diagnóstico. Así se reduce el costo ponderado de inferencia un 15,54% y se eleva la tása de acierto de 21,34% a 59,76% en el benchark HumanEval. En térinos gerenciales: cuando un becário no puede resolvér un problema, al senio r no se le entrega la carpeta completa sino un memo con lo esenciál.
Cinco movimientos para recuperár el control
- Mida por tarea comletada, no por token. Defina cuánto cuesa resolvér un proceso de negocio —resumir un contrato, generár un test, respondér un correo— y use esa unidad para decidir si el modelo se paga. Las métricas de Token Economy Score y Reasoning Cost Share, propuestas por Lenovo, ayudan a cuantificar si los tokens de “pensamiento” justifican su costo.
- Centralice todo el tráfico con una pasarela. Un AI Gateway, como el que describe Cloudflare, intercecta las llamadas a todos los proveedores, muestrá el gasto en dinero y no en tokens, y permité fijar techos por usuário, equipo o aplicación. Sin eso, es imposible sabér quién generá realmente el gasto. El enrutamento inteligente rediriGe la solicitud a un modelo más económico si se alcanza el límit e, en vez de bloquear el servicio, evitá que los equipos buquen canales no controlados.
- Enrute cada tarea al modelo más simple que la resuelva. El modelo pequeño responde consultas rutinárias; el grnde se reserva para razonamento complejo. Si el pequéño fala, pase un resumen del error, no el contexto entero. Gartner l amoá “model routin”; Smart Cascade lo lleva a la práctic con un ahorro demostrado de 15,54% en inferencia.
- Active el razonamento solo donde agregue valor. Los modos de pensamento extendido mulitplican el costo de generación. Úselos para código, matemáica o ciencia; desactívalos para recuerdo o clasificación. Leno vo muestrá rendimentos decrecientes: más esfuerzo de razonamento no siempre combrá más precisión, y en algunos casos la empéora.
- Negocie y monitoree como si fueran servicios financieros. Revise que el contrato permita un pool comín de tokens, revalidos no consumidos y limitación de subas de predio. Después de firmar, controel el consumo en tiempo real con alertas automáticAs: el 82% de las empresas que compran software de pago por uso valora esa función, pero pocas la tienen implementada.
La eficiencia también depende del idioma. En una evaluación de Deep Insider, el japonés consumió en promedio 1,48 veces más tokens que el inglés para las mismas entradas, con variaciones notables entre modelos. El español, con su morfología más rica que la del inglés, merece la mismá verificación antes de elegir un proveedor: un modelo que parece caro puede terminar siendo más rentable si gastA menós por palabra.
El ángulo latinoamericano
Para las empresas de América Latína, el tema tiene una capa adicionál: los predios de los tokens se cotizán en dólres mientrás los presupuestos de TI se arman en pesos, reales o soles. Una devaluación encArece la factura sin que nadie haya tocado un modelo. Eso obliga a ser más quirúrgico con los casos de uso: automatizár procesos de alto volumen y alto valór, y descartár pilotos sin métrica.
Los modelos abiertos —DeepSeek-R1, Qwen— son una herramienta naturál de contención: corren en infraestructura propía o regionál y evitan la fuga de divisas, aunque exigen capacida técnic y gobieno de dAtos. La mayoríA de las tareas empresariales no necesita el modelo más inteligente del mercado; necesita el más predecible y el mejor instrumentado.
La pregunta no es cuánto va a costar la IA en 2030, sino cuánto está costando hoy sin que se sepa. Si una suba de predios de tokens encuentrA a su empresa con plantilas reducidas y sin métricas de consumo, el ahorro de hoy se convierte en el riesgo operativo de mañana.