Google anuncia Gemini 3.8 Flash, que razona más por tarea a cambio de más tokens

Google lanza Gemini 3.8 Flash, un modelo todoterreno que razona más por tarea. Costo oculto: más tokens por diseño. Qué significa para las empresas en Latinoamérica.

Google anuncia Gemini 3.8 Flash, que razona más por tarea a cambio de más tokens

Foto: Samuel Angor

Google presentó Gemini 3.8 Flash, un modelo de inteligencia artificial que no promete una ventana de contexto más grande ni un precio más bajo, sino algo más sutil: un equilibrio nuevo entre velocidad, razonamiento y costo. La compañía lo describe como un modelo "todoterreno" que mejora en ingeniería de software, tareas automatizadas con agentes y razonamiento crítico de varios pasos en dominios especializados respecto de su predecesor.

Qué cambió realmente

El punto central de esta versión es que el modelo puede "trabajar más duro": gasta más tokens por tarea, por diseño, en niveles de esfuerzo más altos. En concreto, el pensamiento predeterminado es `medium` (medio), no `high` (alto) como en Gemini 3 Pro. Una instrucción ajustada en Pro razonará menos en Flash a menos que se configure ese nivel. Y la decisión ahora es de enrutamiento, no global: puntos finales sensibles a la latencia en `low` (bajo), bucles de agente que deben completar el trabajo en `medium` (medio) o `high` (alto).

Patrocinado Advertisement

La diferencia se traduce en ganancias medibles en los puntos de referencia de agentes. Además, los tokens de pensamiento se facturan a la tarifa de salida y se informan por separado en `usageMetadata.thoughtsTokenCount`. La implicación financiera es directa: una respuesta corta en `high` puede costar más que una larga en `low`. Para una empresa que prueba el modelo en producción, esto significa que el presupuesto de IA ya no se calcula por solicitud, sino por nivel de razonamiento asignado a cada flujo de trabajo.

La versión Cyber y el costo de la seguridad

Junto al modelo general, Google lanzó Gemini 3.8 Flash Cyber, una variante especializada en seguridad informática. Según la propia compañía, ya se usó internamente para proteger el código de todos sus sistemas y encontró una vulnerabilidad fundamental crítica en menos de dos horas. Es el tipo de dato que los equipos de seguridad en Latinoamérica deberían mirar con atención: la brecha entre el hallazgo de una falla y su explotación se está cerrando con IA, y la capacidad de análisis automatizado de código deja de ser un lujo.

Qué significa para las empresas de la región

Para un CTO en México, Colombia o Chile, Gemini 3.8 Flash aparece como una opción intermedia: más capaz que los modelos flash anteriores, más barata que los modelos Pro. La conexión con la Búsqueda de Google tiene su propio medidor: 5.000 solicitudes gratuitas por mes compartidas entre todos los modelos Gemini 3.x, y luego 14 dólares por cada 1.000 solicitudes. Existe un nivel gratuito con límite de tasa en AI Studio y la API, y Google señala que los datos del nivel gratuito se "utilizan para mejorar nuestros productos", un detalle que las empresas deberían considerar cuando manejan información sensible.

Hay dos advertencias prácticas. La primera: si vienes de Gemini 3.7 Flash, los cambios son pequeños pero generan errores en producción. El pensamiento `minimal` es rechazado, `thinking_budget` da paso a `thinking_level`, y `candidate_count` no es compatible. La segunda: el modelo acepta texto, imagen, video, audio y PDF como entrada, pero su salida es solo texto. Si tu producto necesita voz o imagen en tiempo real, este modelo es la capa de razonamiento y llamada a herramientas, no toda la pila.

En un mercado donde el costo de inferencia sigue siendo la barrera de entrada para muchas startups latinoamericanas, la promesa de un modelo más capaz no debe leerse como una simple mejora. Es una invitación a repensar la arquitectura: qué tareas realmente necesitan alto razonamiento y cuáles pueden operar con respuestas rápidas. La pregunta para cada equipo de tecnología en la región no es si Gemini 3.8 Flash es más inteligente, sino si su presupuesto puede sostener el costo de hacerlo pensar.

Lee la guía completa de capacidades de la API de Live para conocer las configuraciones clave, incluida la detección de actividad de voz y los niveles de esfuerzo de pensamiento.

Fuentes

  1. Presentamos Gemini 3.8 Live y 3.8 Live Extended Thinking
  2. Comienza a usar la API de Gemini Live con el SDK de IA generativa ...
  3. Google presenta Gemini 3.8 Flash y 3.8 Flash Cyber, sus modelos de IA rápida para programación avanzada y ciberseguridad
  4. ¿Qué es Gemini 3.8 Flash? - Apidog
  5. Profbench: rúbricas de múltiples dominios que requieren conocimiento profesional para responder y evaluar
Melina Rodríguez

Escrito por

Melina Rodríguez

Especialista Inteligencia Artificial

Arquitecta de profesión, estratega de IA por convicción. Máster en Gestión Urbana por la Universidad Politécnica de Cataluña y certificada en ISO 42001 — la norma internacional de gestión de inteligencia artificial. Co-fundadora de 3Dual Studio y consultora en Bewos, ha diseñado programas de alfabetización en IA para organizaciones públicas y privadas en América Latina.