Radar Google anuncia Gemini 3.8 Flash, que razona más por tarea a cambio de más tokens
Google lanza Gemini 3.8 Flash, un modelo todoterreno que razona más por tarea. Costo oculto: más tokens por diseño. Qué significa para las empresas en Latinoamérica.
Google presentó Gemini 3.8 Flash, un modelo de inteligencia artificial que no promete una ventana de contexto más grande ni un precio más bajo, sino algo más sutil: un equilibrio nuevo entre velocidad, razonamiento y costo. La compañía lo describe como un modelo "todoterreno" que mejora en ingeniería de software, tareas automatizadas con agentes y razonamiento crítico de varios pasos en dominios especializados respecto de su predecesor.
Qué cambió realmente
El punto central de esta versión es que el modelo puede "trabajar más duro": gasta más tokens por tarea, por diseño, en niveles de esfuerzo más altos. En concreto, el pensamiento predeterminado es `medium` (medio), no `high` (alto) como en Gemini 3 Pro. Una instrucción ajustada en Pro razonará menos en Flash a menos que se configure ese nivel. Y la decisión ahora es de enrutamiento, no global: puntos finales sensibles a la latencia en `low` (bajo), bucles de agente que deben completar el trabajo en `medium` (medio) o `high` (alto).
La diferencia se traduce en ganancias medibles en los puntos de referencia de agentes. Además, los tokens de pensamiento se facturan a la tarifa de salida y se informan por separado en `usageMetadata.thoughtsTokenCount`. La implicación financiera es directa: una respuesta corta en `high` puede costar más que una larga en `low`. Para una empresa que prueba el modelo en producción, esto significa que el presupuesto de IA ya no se calcula por solicitud, sino por nivel de razonamiento asignado a cada flujo de trabajo.
La versión Cyber y el costo de la seguridad
Junto al modelo general, Google lanzó Gemini 3.8 Flash Cyber, una variante especializada en seguridad informática. Según la propia compañía, ya se usó internamente para proteger el código de todos sus sistemas y encontró una vulnerabilidad fundamental crítica en menos de dos horas. Es el tipo de dato que los equipos de seguridad en Latinoamérica deberían mirar con atención: la brecha entre el hallazgo de una falla y su explotación se está cerrando con IA, y la capacidad de análisis automatizado de código deja de ser un lujo.
Qué significa para las empresas de la región
Para un CTO en México, Colombia o Chile, Gemini 3.8 Flash aparece como una opción intermedia: más capaz que los modelos flash anteriores, más barata que los modelos Pro. La conexión con la Búsqueda de Google tiene su propio medidor: 5.000 solicitudes gratuitas por mes compartidas entre todos los modelos Gemini 3.x, y luego 14 dólares por cada 1.000 solicitudes. Existe un nivel gratuito con límite de tasa en AI Studio y la API, y Google señala que los datos del nivel gratuito se "utilizan para mejorar nuestros productos", un detalle que las empresas deberían considerar cuando manejan información sensible.
Hay dos advertencias prácticas. La primera: si vienes de Gemini 3.7 Flash, los cambios son pequeños pero generan errores en producción. El pensamiento `minimal` es rechazado, `thinking_budget` da paso a `thinking_level`, y `candidate_count` no es compatible. La segunda: el modelo acepta texto, imagen, video, audio y PDF como entrada, pero su salida es solo texto. Si tu producto necesita voz o imagen en tiempo real, este modelo es la capa de razonamiento y llamada a herramientas, no toda la pila.
En un mercado donde el costo de inferencia sigue siendo la barrera de entrada para muchas startups latinoamericanas, la promesa de un modelo más capaz no debe leerse como una simple mejora. Es una invitación a repensar la arquitectura: qué tareas realmente necesitan alto razonamiento y cuáles pueden operar con respuestas rápidas. La pregunta para cada equipo de tecnología en la región no es si Gemini 3.8 Flash es más inteligente, sino si su presupuesto puede sostener el costo de hacerlo pensar.
Lee la guía completa de capacidades de la API de Live para conocer las configuraciones clave, incluida la detección de actividad de voz y los niveles de esfuerzo de pensamiento.