IA hoy Google amplía Gemini 3.8 Flash TTS y elimina los catálogos de voces fijas
Google abre la generación de voces sintéticas a instrucciones en lenguaje natural y clona voces con 30 segundos de audio. El modelo gana benchmarks, pero el control de uso y el precio futuro plantean dudas para empresas latinas.
Google presentó el 23 de septiembre sus modelos Gemini 3.8 Flash TTS y Flash-Lite TTS, la primera generación de síntesis de voz que permite crear voces desde cero mediante lenguaje natural en lugar de elegir entre catálogos predefinidos. El cambio es estructural: la versión anterior ofrecía 30 voces fijas; la nueva acepta instrucciones como "narrador anciano con acento rioplatense, voz grave y pausa cansada" y genera la voz en segundos ITmedia.
Del catálogo a la línea de comandos
Flash TTS soporta 130 idiomas y Flash-Lite 101. Ambos permiten dirección actoral línea por línea —ritmo, emoción, risas, suspiros, muletillas— y mantienen coherencia en contenidos de horas. La clonación de voz ("Voice Replication") funciona con 30 segundos de audio y exige una grabación de consentimiento oral del titular; Google verifica que el hablante coincida con la muestra de referencia ITmedia.
El modelo líder en el benchmark de Hume AI (71,4 global, 60,8 en acentos) y entre los primeros puestos en Voice Arena para japonés, portugués e hindi ITmedia. Paradójicamente, el paper INSTRUCTTTSEVAL —que evalúa justamente seguir instrucciones complejas en TTS— usa a Gemini como juez automático arXiv: Google califica a la competencia con su propio árbitro.
Costos y geografía del bloqueo
Precios introductorios hasta diciembre: Flash TTS 0,50 $/M tokens entrada y 9 $/M salida; Flash-Lite 0,50 $ y 6 $. En enero se duplican. Batch y Flex (procesamiento asíncrono) cuestan la mitad ITmedia. La replicación de voz no está disponible en Google AI Studio para Illinois, Texas, EEA, Reino Unido, Suiza e India ITmedia; Latinoamérica queda fuera del veto, pero la norma anticipa el endurecimiento regulatorio regional.
Qué cambia para una empresa en LatAm
Estudios de doblaje, productoras de audiolibros y call centers pueden reemplazar sesiones de grabación por prompts, pero el bloqueo de precio 2027 y la dependencia de API propietaria convierten la prueba en apuesta estratégica. La marca de agua SynthID y el estándar C2PA en voces clonadas ITmedia reducen riesgo de deepfakes, pero entregan a Google la trazabilidad de cada archivo.
Mientras Figma, HeyGen, LiveKit y Vercel integran la API blog.google, el ejecutivo latinoamericano debe preguntarse: ¿construyo mi capa de voz sobre infraestructura ajena o espero alternativas abiertas que hoy no alcanzan esta calidad?