Google amplía Gemini 3.8 Flash TTS y elimina los catálogos de voces fijas

Google abre la generación de voces sintéticas a instrucciones en lenguaje natural y clona voces con 30 segundos de audio. El modelo gana benchmarks, pero el control de uso y el precio futuro plantean dudas para empresas latinas.

Google amplía Gemini 3.8 Flash TTS y elimina los catálogos de voces fijas

Foto: appshunter.io

Google presentó el 23 de septiembre sus modelos Gemini 3.8 Flash TTS y Flash-Lite TTS, la primera generación de síntesis de voz que permite crear voces desde cero mediante lenguaje natural en lugar de elegir entre catálogos predefinidos. El cambio es estructural: la versión anterior ofrecía 30 voces fijas; la nueva acepta instrucciones como "narrador anciano con acento rioplatense, voz grave y pausa cansada" y genera la voz en segundos ITmedia.

Del catálogo a la línea de comandos

Flash TTS soporta 130 idiomas y Flash-Lite 101. Ambos permiten dirección actoral línea por línea —ritmo, emoción, risas, suspiros, muletillas— y mantienen coherencia en contenidos de horas. La clonación de voz ("Voice Replication") funciona con 30 segundos de audio y exige una grabación de consentimiento oral del titular; Google verifica que el hablante coincida con la muestra de referencia ITmedia.

Patrocinado Advertisement

El modelo líder en el benchmark de Hume AI (71,4 global, 60,8 en acentos) y entre los primeros puestos en Voice Arena para japonés, portugués e hindi ITmedia. Paradójicamente, el paper INSTRUCTTTSEVAL —que evalúa justamente seguir instrucciones complejas en TTS— usa a Gemini como juez automático arXiv: Google califica a la competencia con su propio árbitro.

Costos y geografía del bloqueo

Precios introductorios hasta diciembre: Flash TTS 0,50 $/M tokens entrada y 9 $/M salida; Flash-Lite 0,50 $ y 6 $. En enero se duplican. Batch y Flex (procesamiento asíncrono) cuestan la mitad ITmedia. La replicación de voz no está disponible en Google AI Studio para Illinois, Texas, EEA, Reino Unido, Suiza e India ITmedia; Latinoamérica queda fuera del veto, pero la norma anticipa el endurecimiento regulatorio regional.

Qué cambia para una empresa en LatAm

Estudios de doblaje, productoras de audiolibros y call centers pueden reemplazar sesiones de grabación por prompts, pero el bloqueo de precio 2027 y la dependencia de API propietaria convierten la prueba en apuesta estratégica. La marca de agua SynthID y el estándar C2PA en voces clonadas ITmedia reducen riesgo de deepfakes, pero entregan a Google la trazabilidad de cada archivo.

Mientras Figma, HeyGen, LiveKit y Vercel integran la API blog.google, el ejecutivo latinoamericano debe preguntarse: ¿construyo mi capa de voz sobre infraestructura ajena o espero alternativas abiertas que hoy no alcanzan esta calidad?

Fuentes

  1. «Gemini 3.8 Flash TTS»: modelo de generación de voz para crear voces desde cero, también disponible en «Gemini Notebook»
  2. Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS - The Keyword
  3. Google lanza los modelos de voz Gemini 3.8 en la API y en AI Studio
  4. Instructttseval: Evaluación comparativa del seguimiento de instrucciones complejas en lenguaje natural en sistemas de texto a voz
  5. Uso de la API Web Speech
Marcelo Peguero

Escrito por

Marcelo Peguero

Experto en estándares

Cofundador de ISOINNOVA y especialista en diseño de procesos de calidad, con más de 20 años implantando sistemas de gestión en organizaciones públicas y privadas de Latinoamérica. Su trabajo parte de una convicción simple: un proceso mal diseñado no se arregla poniéndole tecnología encima, se amplifica. Desde ahí mira cómo la inteligencia artificial entra en la operación de las empresas — qué promete, qué mide de verdad y quién termina asumiendo el costo cuando el estándar llega después de la herramienta.