Gemini 3.8 Live ya está en producción; el avatar de Meta sigue en el laboratorio

Google pone a disposición de desarrolladores su modelo de voz más avanzado con precios por minuto y benchmarks independientes. El avatar sincronizado de Meta no tiene endpoint ni fecha.

Gemini 3.8 Live ya está en producción; el avatar de Meta sigue en el laboratorio

Foto: Nathana Rebouças

Google lanzó el 15 de septiembre Gemini 3.8 Live y su variante Extended Thinking como modelos de diálogo en vivo listos para integrar. La versión base ofrece conversación fluida, grounding visual en tiempo casi real y cambio automático entre 97 idiomas. La versión Extended Thinking añade razonamiento en varios pasos mientras habla: logra 82,6 en el Speech to Speech Quality Index de Artificial Analysis y resuelve el 68,6 % de los escenarios τ-Voice de atención al cliente 9to5Google.

Ambos IDs (`gemini-3.8-live` y `gemini-3.8-live-extended-thinking`) están activos en la API de Gemini y en AI Studio con tarifa publicada: 0,005 USD/min de audio de entrada y 0,018 USD/min de salida OrcaRouter.

En paralelo, Meta presentó el 23 de septiembre Muse Realtime Avatar: genera vídeo vertical 448×768 a 25 fps sincronizado con voz a partir de una imagen de referencia. La latencia reportada por la propia empresa es de 870 ms al primer byte, pero no hay API pública, ni lista de precios, ni fecha de disponibilidad OrcaRouter. La asimetría es total: uno es producto facturable hoy; el otro, una demostración de investigación.

Patrocinado Advertisement

Qué significa para América Latina

La brecha de time-to-market define la decisión inmediata. Equipos en México, Colombia o Brasil pueden prototipar mañana un agente de voz bancario o de soporte con Gemini 3.8 Live Extended Thinking y conocer su coste por minuto antes de escalar. El avatar de Meta, aunque prometedor para casos que requieren presencia visual (educación, retail inmersivo), no ofrece hoy ni endpoint ni SLA.

La cadena de suministro de modelos de voz speech-to-speech maduros ya existe en la nube; la capa visual aún no.

Hoja de ruta práctica

  • Lanzamiento este trimestre: integra Gemini 3.8 Live (estándar para costo, Extended Thinking para complejidad) y enruta el razonamiento pesado a modelos de texto vía router multi-proveedor.
  • Capa visual: vigila la publicación de precio, endpoint y fecha de Muse; mientras tanto, trata la generación de vídeo como experimento interno.
  • Benchmark real: la única métrica comparable hoy es el índice de Artificial Analysis (76,0 y 82,6). Las latencias de Meta y Google miden cosas distintas y no son equiparables OrcaRouter.

La conversación de voz ya es commodity con SLA; la cara del agente sigue siendo vaporware.

Fuentes

  1. Presentamos Gemini 3.8 Live con Avatar en Vivo
  2. El pensamiento extendido de Gemini 3.8 Live potencia Gemini Live y Gmail
  3. Avatar en Tiempo Real de Muse vs Gemini 3.8 Live: Cara vs Voz - OrcaRouter
  4. Google lanza su modelo de audio más avanzado: ¿De qué se trata?
  5. Denise: Un Avatar Autónomo en Tiempo Real para la Interacción Humano–IA Multimodal
Melina Rodríguez

Escrito por

Melina Rodríguez

Especialista Inteligencia Artificial

Arquitecta de profesión, estratega de IA por convicción. Máster en Gestión Urbana por la Universidad Politécnica de Cataluña y certificada en ISO 42001 — la norma internacional de gestión de inteligencia artificial. Co-fundadora de 3Dual Studio y consultora en Bewos, ha diseñado programas de alfabetización en IA para organizaciones públicas y privadas en América Latina.