Google presenta Gemini 3.8 Live y Extended Thinking

Google lanza Gemini 3.8 Live y Extended Thinking: el segundo lidera benchmarks de razonamiento (82.6), pero evaluadores humanos siguen prefiriendo el modelo anterior 3.1 Flash por naturalidad. Dilema estratégico para productos de voz en LatAm.

Google presenta Gemini 3.8 Live y Extended Thinking

Foto: appshunter.io

Google presentó el 15 de septiembre dos variantes de su modelo de audio más avanzado: Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking. La división no es cosmética: refleja una tensión estructural en la IA de voz actual. Los benchmarks técnicos coronan a Extended Thinking; las pruebas a ciegas con humanos siguen eligiendo a su predecesor, Gemini 3.1 Flash Live.

El dividendo de los datos

El índice Speech-to-Speech de Artificial Analysis —que promedia razonamiento del habla, desempeño como agente, preferencia en arena y tasa de éxito en tareas— ubica a Extended Thinking en primer lugar con 82,6 puntos, por delante de GPT-Live-1 Astra (81,5) y Grok Voice Think Fast 2.0 High (81,3). El modelo estándar 3.8 Live queda quinto con 76,0; ambos superan al 3.1 Flash Live High (71,5) fuente.

Patrocinado Advertisement

La brecha se ensancha en capacidades de agente: Extended Thinking resuelve 68.6% de la prueba Tau Voice frente al 37.7% de la generación anterior. En razonamiento del habla alcanza 97.7%, solo superado por Qwen Audio 3.0 Realtime Plus (99.2%).

Pero la métrica que define la adopción real —preferencia humana en conversaciones a ciegas (Speech Agent Arena)— cuenta otra historia. Gemini 3.1 Flash Live mantiene el liderazgo con Elo 1096. El 3.8 Live estándar marca 1083. Extended Thinking cae a 990, aunque completa 89,1 % de sus tareas asignadas fuente.

Dos APIs, dos filosofías

Según la documentación técnica, Google mantiene arquitecturas separadas para casos de uso distintos. La API Live está diseñada para "audio interactivo y no estructurado, entradas y salidas multimodales" y "contextos conversacionales dinámicos". La API de TTS controlable (Interactions API) apunta a "recitación de texto exacta con control detallado sobre el estilo y el sonido, como la generación de podcasts o audiolibros" fuente.

Esta última permite instrucciones en lenguaje natural para guiar "estilo, acento, ritmo y tono" —lo que la industria llama TTS controlable— y soporta generación multi-orador. Está en preview y usa modelos Gemini 2.5 con capacidades TTS (el ejemplo de código referencia `gemini-3.1-flash-tts-preview`) fuente.

El costo como palanca regional

Para empresas latinoamericanas, la economía cambia la ecuación. El 3.8 Live estándar cuesta 0,84 dólares por hora de audio de entrada: la mitad que su predecesor (1,75 dólares) y la tarifa más baja del índice. Extended Thinking cuesta 3,50 dólares/hora, aún por debajo de GPT-Live-1 Sol (4,47) y Grok Voice Think Fast 2.0 High (4,80) fuente.

Hasta el primer audio, la latencia promedio bajó a 1,18 segundos desde 2,99 segundos. En regiones donde la conectividad y el costo por minuto de cómputo pesan, esa reducción y el precio base abren la puerta a asistentes de voz, IVR inteligentes y contenido de audio a escala.

El benchmark que falta

Un paper de la Universidad de Fudan (INSTRUCTTTSEVAL) expone el hueco de evaluación que ningún proveedor cierra: medir qué tan bien un sistema sigue instrucciones complejas de estilo —"habla con urgencia y ansiedad", "tono de profesor regañando"— más allá de etiquetas fijas. El benchmark propone tres tareas jerárquicas (especificación acústica, directiva descriptiva, role-play) con 6.000 casos de prueba y usa a Gemini como juez automático (LLM-as-a-judge) fuente.

Los resultados preliminares muestran que "el control acústico fino sigue siendo un desafío abierto importante incluso para los modelos mejor puntuados". La evaluación incluye ofertas comerciales como Hume AI, ElevenLabs, GPT-4o-mini TTS y la propia API de Gemini fuente.

La decisión de producto

No hay modelo único que gane en todo. Un banco que automatice atención telefónica en México o Colombia priorizará latencia, costo por hora y naturalidad percibida: el 3.8 Live estándar o incluso el 3.1 Flash Live. Una productora de audiolibros o podcasts en Argentina o Chile necesitará control fino de estilo, pausas, emociones: la API TTS controlable. Un agente que resuelva trámites complejos por voz (razonamiento multi-paso, uso de herramientas) justificará el sobrecosto de Extended Thinking.

Google lidera hoy ambas escalas —razonamiento y preferencia— pero con modelos diferentes. La apuesta estratégica para un CTO en la región no es "cuál es el mejor", sino "cuál resuelve mi caso de uso al menor costo operacional". Mientras la industria converja en un estándar de evaluación que alinee benchmarks con experiencia humana, la fragmentación seguirá siendo la norma.

Fuentes

  1. Gemini 3.8 de texto a voz dice hola
  2. Generación de texto a voz (TTS) - Interactions API | Google AI for ...
  3. Google lanza su modelo de audio más avanzado: ¿De qué se trata?
  4. Instructttseval: Evaluación comparativa del seguimiento de instrucciones complejas en lenguaje natural en sistemas de texto a voz
  5. Web Speech API
Valmis Di Carlo

Escrito por

Valmis Di Carlo

Especialista en infraestructura

Especialista en administración de sistemas UNIX/Linux, ciberseguridad e infraestructura tecnológica, con experiencia en consultoría TI, investigación computacional y operación de entornos críticos. Desde DICATECH, SRL, combina dominio técnico en OpenBSD, FreeBSD, Solaris y GNU/Linux con una mirada práctica sobre seguridad, continuidad y arquitectura de servicios, ayudando a organizaciones a construir plataformas más estables, seguras, auditables, escalables y resilientes.