Google presentó el 15 de septiembre dos variantes de su modelo de audio más avanzado: Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking. La división no es cosmética: refleja una tensión estructural en la IA de voz actual. Los benchmarks técnicos coronan a Extended Thinking; las pruebas a ciegas con humanos siguen eligiendo a su predecesor, Gemini 3.1 Flash Live.
El dividendo de los datos
El índice Speech-to-Speech de Artificial Analysis —que promedia razonamiento del habla, desempeño como agente, preferencia en arena y tasa de éxito en tareas— ubica a Extended Thinking en primer lugar con 82,6 puntos, por delante de GPT-Live-1 Astra (81,5) y Grok Voice Think Fast 2.0 High (81,3). El modelo estándar 3.8 Live queda quinto con 76,0; ambos superan al 3.1 Flash Live High (71,5) fuente.
La brecha se ensancha en capacidades de agente: Extended Thinking resuelve 68.6% de la prueba Tau Voice frente al 37.7% de la generación anterior. En razonamiento del habla alcanza 97.7%, solo superado por Qwen Audio 3.0 Realtime Plus (99.2%).
Pero la métrica que define la adopción real —preferencia humana en conversaciones a ciegas (Speech Agent Arena)— cuenta otra historia. Gemini 3.1 Flash Live mantiene el liderazgo con Elo 1096. El 3.8 Live estándar marca 1083. Extended Thinking cae a 990, aunque completa 89,1 % de sus tareas asignadas fuente.
Dos APIs, dos filosofías
Según la documentación técnica, Google mantiene arquitecturas separadas para casos de uso distintos. La API Live está diseñada para "audio interactivo y no estructurado, entradas y salidas multimodales" y "contextos conversacionales dinámicos". La API de TTS controlable (Interactions API) apunta a "recitación de texto exacta con control detallado sobre el estilo y el sonido, como la generación de podcasts o audiolibros" fuente.
Esta última permite instrucciones en lenguaje natural para guiar "estilo, acento, ritmo y tono" —lo que la industria llama TTS controlable— y soporta generación multi-orador. Está en preview y usa modelos Gemini 2.5 con capacidades TTS (el ejemplo de código referencia `gemini-3.1-flash-tts-preview`) fuente.
El costo como palanca regional
Para empresas latinoamericanas, la economía cambia la ecuación. El 3.8 Live estándar cuesta 0,84 dólares por hora de audio de entrada: la mitad que su predecesor (1,75 dólares) y la tarifa más baja del índice. Extended Thinking cuesta 3,50 dólares/hora, aún por debajo de GPT-Live-1 Sol (4,47) y Grok Voice Think Fast 2.0 High (4,80) fuente.
Hasta el primer audio, la latencia promedio bajó a 1,18 segundos desde 2,99 segundos. En regiones donde la conectividad y el costo por minuto de cómputo pesan, esa reducción y el precio base abren la puerta a asistentes de voz, IVR inteligentes y contenido de audio a escala.
El benchmark que falta
Un paper de la Universidad de Fudan (INSTRUCTTTSEVAL) expone el hueco de evaluación que ningún proveedor cierra: medir qué tan bien un sistema sigue instrucciones complejas de estilo —"habla con urgencia y ansiedad", "tono de profesor regañando"— más allá de etiquetas fijas. El benchmark propone tres tareas jerárquicas (especificación acústica, directiva descriptiva, role-play) con 6.000 casos de prueba y usa a Gemini como juez automático (LLM-as-a-judge) fuente.
Los resultados preliminares muestran que "el control acústico fino sigue siendo un desafío abierto importante incluso para los modelos mejor puntuados". La evaluación incluye ofertas comerciales como Hume AI, ElevenLabs, GPT-4o-mini TTS y la propia API de Gemini fuente.
La decisión de producto
No hay modelo único que gane en todo. Un banco que automatice atención telefónica en México o Colombia priorizará latencia, costo por hora y naturalidad percibida: el 3.8 Live estándar o incluso el 3.1 Flash Live. Una productora de audiolibros o podcasts en Argentina o Chile necesitará control fino de estilo, pausas, emociones: la API TTS controlable. Un agente que resuelva trámites complejos por voz (razonamiento multi-paso, uso de herramientas) justificará el sobrecosto de Extended Thinking.
Google lidera hoy ambas escalas —razonamiento y preferencia— pero con modelos diferentes. La apuesta estratégica para un CTO en la región no es "cuál es el mejor", sino "cuál resuelve mi caso de uso al menor costo operacional". Mientras la industria converja en un estándar de evaluación que alinee benchmarks con experiencia humana, la fragmentación seguirá siendo la norma.