Agentes de IA: cuando la eficiencia se come el presupuesto

Cada agente consume hasta 1000 veces más tokens que un chat. Uber agotó su presupuesto de IA en tres meses. ¿Cómo evitar que tu empresa sea la próxima?

Agentes de IA: cuando la eficiencia se come el presupuesto

Foto: Jakub Żerdzicki

Primero fue la promesa: agentes de IA que trabajan solos, leen repositorios, ejecutan herramientas, resuelven issues en GitHub sin supervisión humana. Después llegó la factura. Y para algunas empresas, esa factura llegó mucho antes de lo esperado.

Uber agotó todo su presupuesto de inteligencia artificial para 2026 en abril. Forbes reportó el dato sin aspavientos, pero la moraleja recorre los pasillos de finanzas: la era de los agentes autónomos trae una economía que nadie modeló bien.

Un estudio reciente de la Universidad de Michigan y Stanford sobre consumo de tokens en tareas de codificación agéntica revela una realidad incómoda: estas tareas consumen en promedio 3500 veces más tokens que una consulta de razonamiento simple y 1200 veces más que una conversación típica de chat. Y lo que encarece no son los tokens de salida (lo que el modelo genera), sino los de entrada: el contexto que el agente acumula ronda tras ronda, arrastrando historiales completos, archivos leídos, herramientas invocadas.

Patrocinado Advertisement

El costo oculto de "dejarlo trabajar"

Cuando un agente autónomo se pone a resolver un problema real de código, su comportamiento es sorprendentemente impredecible. El mismo modelo, ante la misma tarea, puede consumir hasta 30 veces más tokens en una ejecución que en otra. Y lo más contraproducente: gastar más tokens no garantiza mejor resultado. El estudio muestra que la precisión alcanza su pico en un punto intermedio de gasto y luego se estanca o empeora. El exceso de tokens suele reflejar exploración improductiva, no razonamiento más profundo.

OpenAI, en su guía para gestionar inversiones en IA en la era de los agentes, lo explica con claridad: "el precio por token por sí solo no muestra si la IA está creando valor. Los líderes deben mirar el trabajo útil por dólar". La compañía sugiere cinco pasos que aplican sobre todo a empresas que no tienen el bolsillo de Uber:

  • Visibilidad granular: quién usa qué modelo, para qué tipo de trabajo, y cuánta capacidad consume. Sin eso, una factura creciente es indescifrable.
  • Evaluar por ROI de resultado: un modelo más barato por token puede salir más caro si fracasa, reintenta y requiere revisión humana. El costo real es el del resultado aceptado (issue resuelto, caso de soporte cerrado, cambio probado).
  • Gobernar antes de escalar: definir qué contexto puede usar el agente, qué herramientas accede, qué acciones puede ejecutar y quién aprueba pasos de alto riesgo.
  • Financiar como portafolio: acceso amplio para productividad diaria, flujos específicos para trabajo repetitivo, y unas pocas apuestas estratégicas con contexto propietario de la empresa.
  • Ajustar capacidad a demanda probada: no levantar límites generales sin evidencia de que el flujo de trabajo genera valor.

Lo que nadie te dice sobre los tokens de entrada

El paper de Stanford identifica un hallazgo clave: el costo de los agentes está dominado por los tokens de entrada, no de salida. Cada ronda del agente lleva consigo todo el historial previo. Eso hace que incluso con caché de tokens (que reduce costos parcialmente), la factura se dispare. Modelos como Kimi-K2 y Claude Sonnet 4.5 consumieron en promedio 1,5 millones de tokens más que GPT-5 en las mismas tareas. La eficiencia varía enormemente entre modelos, y no siempre correlaciona con el precio por token.

Deloitte, en su informe de predicciones TMT 2026, estima que el mercado de agentes autónomos de IA podría alcanzar los 45.000 millones de dólares en 2030 si las empresas logran orquestarlos bien. Pero advierte: "la brecha entre la promesa y la realidad se estrechará, pero no desaparecerá". El trabajo ingrato —higiene de datos, integración en flujos existentes, gobernanza, nuevos modelos de precios— es lo que realmente permitirá escalar.

¿Y en América Latina?

Para una startup o empresa mediana latinoamericana, quemar el presupuesto de IA de todo un año en tres meses no es solo un inconveniente: es existencial. La región no tiene el colchón de capital de los gigantes tecnológicos. Cada dólar invertido en tokens debe justificarse. La recomendación de OpenAI de "evaluar por ROI de resultado" no es un lujo de consultoría, es una necesidad operativa.

BCG lo condensa en una frase que debería estar en la pared de todo CTO regional: "gestionar las máquinas que se gestionan a sí mismas". Los agentes son autónomos, pero la supervisión de su gasto no puede serlo. El problema no es la tecnología, es que nadie había modelado bien cuánto cuesta realmente dejar que una IA piense sola durante horas.

El verdadero riesgo no es que los agentes no funcionen, sino que funcionen tan bien —y consuman tanto— que los equipos de finanzas pongan el freno de mano justo cuando empiezan a generar valor. ¿Tu organización ya sabe qué flujo de trabajo agéntico vale la pena escalar, o va a descubrirlo cuando llegue el extracto bancario?

Fuentes

  1. Cómo gestionar las inversiones en IA en la era de los agentes
  2. ¿Cómo gastan tu dinero los agentes de IA? Análisis y predicción del consumo de tokens en tareas de codificación agentiva
  3. Uber gastó todo su presupuesto de IA de 2026 en abril. Las pequeñas empresas son las siguientes
  4. Gestionando las máquinas que se gestionan a sí mismas | BCG
  5. Estrategia de IA agentiva | Deloitte Insights
Elvyn Peguero

Escrito por

Elvyn Peguero

Consultor digital e IA

Consultor de transformación digital e inteligencia artificial con más de 15 años navegando la intersección entre tecnología, gobierno y empresa. Arquitectó el Framework Normativo TIC del Estado Dominicano y ha liderado proyectos de IA aplicada en sectores públicos y privados desde Bewos AI Consulting. Editor para República Dominicana en ITNOW durante seis años, donde desarrolló un ojo clínico para explicar tecnología compleja en lenguaje que cualquier ejecutivo puede entender.