Google lanza Gemini 3.8 Live: latencia 1.18 s, precio $0.84/h, pero humanos prefieren 3.1

Google presenta sus modelos de audio más avanzados con latencia de 1.18s y precio de $0.84/hora. Lideran benchmarks, pero testers humanos siguen prefiriendo Gemini 3.1 Flash Live. Infraestructura de red en LatAm será clave.

Google lanza Gemini 3.8 Live: latencia 1.18 s, precio $0.84/h, pero humanos prefieren 3.1

Foto: Franck

Google lanzó el 15 de septiembre Gemini 3.8 Live y su variante Extended Thinking, sus modelos de audio más avanzados hasta la fecha. La promesa: agentes de voz que razonan y ejecutan tareas mientras mantienen una conversación fluida, sin la estructura rígida de prompt-respuesta AI Business.

La arquitectura separa la latencia de interacción —el retraso entre acción del usuario y respuesta del sistema— de la latencia de razonamiento. "Está haciendo razonamiento en segundo plano durante la conversación", explica Sid Nag de Tekonyx. El modelo puede realizar llamadas a APIs y herramientas mientras transmite audio, procesar entradas visuales en vivo y soportar más de 97 idiomas AI Business.

Benchmarks versus preferencia humana

Patrocinado Advertisement

La versión Extended Thinking encabeza el Speech-to-Speech Index de Artificial Analysis con 82,6 puntos, superando a GPT-Live-1 (81,5) y Grok Voice (81,3). En la prueba Tau Voice de capacidades agente alcanza 68,6 % frente al 37,7 % de la generación anterior BeInCrypto.

Pero hay una grieta: en pruebas de preferencia a ciegas (Speech Agent Arena), los evaluadores humanos siguen eligiendo Gemini 3.1 Flash Live (Elo 1096) sobre el nuevo 3.8 Live (1083) y Extended Thinking (990). La IA que mejor razona no necesariamente es la que mejor conversa.

El factor precio y la realidad de la red

El modelo estándar cuesta $0.84 por hora de audio de entrada, la mitad que su predecesor ($1.75) y la tarifa más baja del índice. Extended Thinking sale a $3.50/hora, más barato que GPT-Live-1 Sol ($4.47) y Grok Voice ($4.80) BeInCrypto. La latencia promedio al primer audio cayó a 1.18 segundos desde 2.99 segundos.

Sin embargo, un estudio de IEEE advierte que la infraestructura de red actual no está preparada para interacciones generativas en tiempo real: faltan adaptación rápida y estrategias de transporte consistentes para patrones de tráfico únicos IEEE. La solución propuesta pasa por usar el edge como relay inteligente.

Qué significa para América Latina

Para empresas en la región, el abaratamiento radical abre casos de uso en soporte, ventas y educación multilingüe —Google documenta 70 idiomas compatibles en su API Google AI—. Pero la dependencia de WebSockets estado y baja latencia exige conectividad estable y, idealmente, nodos de edge cercanos. Donde la red falla, la "conversación natural" se rompe.

Google está alcanzando a Apple en transcripción en tiempo real, pero lleva la interacción un escalón más allá: el agente no elige entre ser rápido o reflexivo. El problema es que la infraestructura latinoamericana, con sus asimetrías de ancho de banda y latencia variable, puede convertirse en el cuello de botella que ningún benchmark resuelve.

Fuentes

  1. Gemini 3.8 Live transforma la IA conversacional
  2. Descripción general de la API de Gemini Live | Gemini API | Google AI for Developers
  3. Interacción en tiempo real entre humanos e IA generativa: desafíos y oportunidades de red
  4. Google lanza su modelo de audio más avanzado: ¿De qué se trata?
Marcelo Peguero

Escrito por

Marcelo Peguero

Experto en estándares

Cofundador de ISOINNOVA y especialista en diseño de procesos de calidad, con más de 20 años implantando sistemas de gestión en organizaciones públicas y privadas de Latinoamérica. Su trabajo parte de una convicción simple: un proceso mal diseñado no se arregla poniéndole tecnología encima, se amplifica. Desde ahí mira cómo la inteligencia artificial entra en la operación de las empresas — qué promete, qué mide de verdad y quién termina asumiendo el costo cuando el estándar llega después de la herramienta.