Gemini 3.6 Flash: Google aprieta el costo de los agentes, pero ¿quién puede pagarlo?

Google lanza modelos flash que reducen tokens hasta 65% y bajan precios, pero la ecuación de costos sigue siendo un lujo para startups latinoamericanas. Análisis crítico.

Gemini 3.6 Flash: Google aprieta el costo de los agentes, pero ¿quién puede pagarlo?

Foto: Solen Feyissa

Google acaba de soltar tres modelos que prometen cambiar la economía de los agentes autónomos: Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber. La promesa es una reducción de hasta 17% en tokens de salida —y en pruebas sintéticas, hasta 65%— con precios de 1,50 dólares por millón de tokens de entrada y 7,50 por millón de salida. Pero cuando se mira la letra chica, la pregunta incómoda es si esta eficiencia está diseñada para los que ya tienen escala, no para los que la necesitan.

Gemini 3.6 Flash se vende como el caballo de batalla para agentes que razonan en múltiples pasos. La documentación de Google muestra un salto en benchmarks: en DeepSWE pasa de 37% a 49% de éxito, y en MLE Bench sube de 49,7% a 63,9%. Figma, Hebbia y Harvey ya lo integran. Pero el problema no es la capacidad técnica, sino el umbral de entrada. A 7,50 dólares por millón de tokens de salida, una startup latinoamericana que procese 10 millones de tokens al día —un volumen modesto para un agente de atención al cliente— pagaría 75 dólares diarios solo en salida, más de 2.200 dólares al mes. Para una empresa en México o Colombia, eso puede ser el sueldo de un desarrollador junior.

La trampa del token barato

Patrocinado Advertisement

El benchmark independiente de Mohit Khare sobre 17 modelos muestra que la eficiencia de tokenización varía entre 1,18 y 1,35 tokens por palabra según el tokenizer. Google no es el más eficiente —DeepSeek lo supera— pero su estrategia de precios para la serie Flash comprime los márgenes de los proveedores rivales. Sin embargo, el costo real no está solo en el token, sino en el volumen de inferencia que un agente necesita para ser útil. Un agente que resuelve una consulta en tres pasos puede gastar 500 tokens de salida; a 7,50 dólares por millón, eso son 0,00375 dólares por consulta. Parece barato hasta que multiplicas por 10.000 consultas diarias: 37,50 dólares al día. En un país con tipo de cambio desfavorable, eso pesa.

Gemini 3.5 Flash-Lite, a 350 tokens por segundo y diseñado para búsqueda y procesamiento de documentos, baja aún más el precio de entrada: 0,25 dólares por millón de tokens de entrada y 1,50 de salida. Pero es un modelo más limitado, pensado para tareas repetitivas de bajo razonamiento. La segmentación es clara: Google quiere que los equipos técnicos elijan según el caso de uso, pero esa elección exige un nivel de sofisticación que muchas empresas latinoamericanas aún no tienen. La mayoría sigue usando modelos todo-en-uno sin optimizar, y el costo se dispara.

El modelo que no llega

Gemini 3.5 Pro, prometido para junio, sigue en pruebas con socios. Google dice que estará listo "tan pronto como esté listo". Mientras tanto, la familia Flash es lo único disponible para producción. Para una empresa en Latinoamérica que necesita un modelo de razonamiento profundo —por ejemplo, para análisis de contratos legales o diagnóstico financiero— la opción es pagar el precio de salida de 9 dólares por millón de Gemini 3.5 Flash estándar, o esperar. Ninguna de las dos es buena.

El riesgo de seguridad como negocio

El modelo Gemini 3.5 Flash Cyber, diseñado para detectar y corregir vulnerabilidades de código, se desplegará solo con gobiernos y socios de confianza a través de CodeMender. Google dice que es para evitar mal uso. Pero la decisión de restringir el acceso a un modelo de seguridad, mientras se vende libremente el modelo de propósito general, plantea una pregunta: ¿quién decide qué capacidades son peligrosas? Para las empresas latinoamericanas que dependen de código abierto o tienen equipos de seguridad pequeños, esta asimetría significa que no podrán acceder a herramientas de remediación automatizada que sí tendrán grandes corporaciones o gobiernos.

La ecuación que no cierra para LatAm

El costo total de operar un agente con Gemini 3.6 Flash no es solo el precio por token. Hay que sumar latencia, almacenamiento en caché de contexto, y la integración con APIs de búsqueda que cuestan 14 dólares por cada 1.000 consultas. Para una startup latinoamericana que compite globalmente, cada dólar cuenta. La eficiencia de Google es real, pero está calibrada para volúmenes que pocos en la región pueden sostener. La verdadera pregunta no es si el modelo es bueno, sino cuánto tiempo pasará antes de que los costos bajen lo suficiente como para que un agente sea rentable para una pyme en Lima o Bogotá. Mientras tanto, la brecha entre quienes pueden pagar el lujo de la inferencia y quienes no, se ensancha.

Fuentes

  1. Google Gemini 3.6 Flash se enfoca en los costos de tokens de agentes empresariales
  2. Los nuevos Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber consumen menos tokens sin renunciar a velocidad y calidad
  3. Precios de la API de Gemini Developer - Google AI para Desarrolladores
  4. Benchmarks de estimación de tokens de LLM: Eficiencia del tokenizador y análisis de costos en 17 modelos de lenguaje grandes
  5. Google Gemini 3.5 Pro (Junio 2026): 4x Más Rápido que ... - Davarion
Redacción

Escrito por

Redacción

Turing magazine

Equipo editorial de Turingmag. Cobertura institucional sobre inteligencia artificial para ejecutivos y directivos en Latinoamérica.