IA hoy Google lanza Gemini 3.8 Live: latencia 1.18 s, precio $0.84/h, pero humanos prefieren 3.1
Google presenta sus modelos de audio más avanzados con latencia de 1.18s y precio de $0.84/hora. Lideran benchmarks, pero testers humanos siguen prefiriendo Gemini 3.1 Flash Live. Infraestructura de red en LatAm será clave.
Google lanzó el 15 de septiembre Gemini 3.8 Live y su variante Extended Thinking, sus modelos de audio más avanzados hasta la fecha. La promesa: agentes de voz que razonan y ejecutan tareas mientras mantienen una conversación fluida, sin la estructura rígida de prompt-respuesta AI Business.
La arquitectura separa la latencia de interacción —el retraso entre acción del usuario y respuesta del sistema— de la latencia de razonamiento. "Está haciendo razonamiento en segundo plano durante la conversación", explica Sid Nag de Tekonyx. El modelo puede realizar llamadas a APIs y herramientas mientras transmite audio, procesar entradas visuales en vivo y soportar más de 97 idiomas AI Business.
Benchmarks versus preferencia humana
La versión Extended Thinking encabeza el Speech-to-Speech Index de Artificial Analysis con 82,6 puntos, superando a GPT-Live-1 (81,5) y Grok Voice (81,3). En la prueba Tau Voice de capacidades agente alcanza 68,6 % frente al 37,7 % de la generación anterior BeInCrypto.
Pero hay una grieta: en pruebas de preferencia a ciegas (Speech Agent Arena), los evaluadores humanos siguen eligiendo Gemini 3.1 Flash Live (Elo 1096) sobre el nuevo 3.8 Live (1083) y Extended Thinking (990). La IA que mejor razona no necesariamente es la que mejor conversa.
El factor precio y la realidad de la red
El modelo estándar cuesta $0.84 por hora de audio de entrada, la mitad que su predecesor ($1.75) y la tarifa más baja del índice. Extended Thinking sale a $3.50/hora, más barato que GPT-Live-1 Sol ($4.47) y Grok Voice ($4.80) BeInCrypto. La latencia promedio al primer audio cayó a 1.18 segundos desde 2.99 segundos.
Sin embargo, un estudio de IEEE advierte que la infraestructura de red actual no está preparada para interacciones generativas en tiempo real: faltan adaptación rápida y estrategias de transporte consistentes para patrones de tráfico únicos IEEE. La solución propuesta pasa por usar el edge como relay inteligente.
Qué significa para América Latina
Para empresas en la región, el abaratamiento radical abre casos de uso en soporte, ventas y educación multilingüe —Google documenta 70 idiomas compatibles en su API Google AI—. Pero la dependencia de WebSockets estado y baja latencia exige conectividad estable y, idealmente, nodos de edge cercanos. Donde la red falla, la "conversación natural" se rompe.
Google está alcanzando a Apple en transcripción en tiempo real, pero lleva la interacción un escalón más allá: el agente no elige entre ser rápido o reflexivo. El problema es que la infraestructura latinoamericana, con sus asimetrías de ancho de banda y latencia variable, puede convertirse en el cuello de botella que ningún benchmark resuelve.