Google lanza Gemini Omni 1.1 Flash con video de 15 segundos y edición conversacional

Google actualiza su modelo de video unificado: planos de 15 segundos, referencias mixtas, edición en el cuadro y marca de agua SynthID obligatoria. Disponible en IA Plus/Pro/Ultra, Flow y YouTube Shorts.

Google lanza Gemini Omni 1.1 Flash con video de 15 segundos y edición conversacional

Foto: 0xk

Google puso en producción la versión 1.1 de Gemini Omni Flash, su modelo de video nativamente multimodal presentado en mayo durante Google I/O. La actualización no añade "inteligencia" abstracta: entrega controles que los creadores pedían para dejar de tratar la generación como una ruleta.

Qué cambia en la práctica

La lista es corta y concreta:

Patrocinado Advertisement
  • Referencias múltiples en un mismo prompt: texto, varias imágenes, un clip de video y una pista de audio guían la generación simultáneamente. Antes aceptaba solo una imagen.
  • Planos continuos más largos: 12 segundos en el tier Lite y 15 en Open sin cortes. La cámara, el movimiento y el audio se mantienen coherentes.
  • Edición conversacional *in-frame*: pides "cambia el fondo a una calle cyberpunk" o "arregla la mano" y el modelo re-renderiza solo esa región conservando iluminación, trayectorias y consistencia de personaje.
  • Audio nativo sincronizado: ambiente, foley y música se generan en la misma pasada que el video; se activa o desactiva por render y el costo de créditos se ajusta solo.
  • Física y personaje consistentes: gravedad, telas, líquidos y la identidad visual del protagonista se mantienen entre tomas y ediciones.
  • SynthID en cada salida: marca de agua imperceptible obligatoria para trazabilidad.

Arquitectura: no es un pipeline, es un solo modelo

La diferencia con Veo (su predecesor en el ecosistema Gemini) es estructural. Veo requería convertir entradas a descripciones de texto y luego pasarlas a un renderizador aparte. Gemini Omni razona sobre texto, imagen, audio y video en un único motor central. Eso preserva detalles visuales que la conversión a texto solía borrar y permite el bucle de varios turnos: cada instrucción se apila sobre la anterior sin reiniciar la generación.

Acceso y capas

  • Suscriptores Google AI Plus / Pro / Ultra (global) vía app Gemini.
  • Google Flow para flujos de trabajo de cortometrajes.
  • YouTube Shorts / YouTube Create para formato corto.
  • API para desarrolladores: disponible "en pocas semanas" tras el lanzamiento de mayo.
  • Una plataforma de terceros, geminiomni.studio, ofrece versión de prueba con créditos gratis, sin API key y desde el navegador —barrera de entrada casi nula.

Lectura para LatAm: regulación y costo de oportunidad

Brasil (PL 2338/2023) y México ya discuten leyes que exigen etiquetado de contenido sintético. SynthID deja de ser una feature de seguridad para volverse herramienta de cumplimiento: si tu video lleva la marca, tienes evidencia técnica de origen. Quien no la use quedará expuesto a riesgos legales y de plataforma.

En el lado productivo, agencias en Ciudad de México, São Paulo, Bogotá o Buenos Aires pueden prototipar spots de producto, reels de turismo o píldoras de edtech en minutos. Pero el cuello de botella ya no es el render: es quién escribe los prompts. La edición conversacional exige lenguaje cinematográfico (óptica, luz, continuidad), no solo "haz un video de...". Equipos que no desarrollen esa capacidad terminarán pagando premium por plantillas ajenas.

La apuesta estratégica

Google integra Omni en su pila: Workspace, Cloud, YouTube, Android. El lock-in es real. La pregunta para el ejecutivo no es "¿pruebo esto?" sino "¿construyo capacidad interna de dirección de IA multimodal o me suscribo al flujo de Google?". El modelo razona entre modalidades; tu organización debe aprender a dirigir ese razonamiento.

Fuentes

  1. Gemini Omni 1.1 Flash te permite crear con más control
  2. Gemini Omni 1.1 Flash te permite crear con más control
  3. Gemini Omni 1.1 — Novedades del modelo unificado de vídeo, imagen y audio
  4. Google Gemini Omni: características, precios y guía de Google Flow
Elvyn Peguero

Escrito por

Elvyn Peguero

Consultor digital e IA

Consultor de transformación digital e inteligencia artificial con más de 15 años navegando la intersección entre tecnología, gobierno y empresa. Arquitectó el Framework Normativo TIC del Estado Dominicano y ha liderado proyectos de IA aplicada en sectores públicos y privados desde Bewos AI Consulting. Editor para República Dominicana en ITNOW durante seis años, donde desarrolló un ojo clínico para explicar tecnología compleja en lenguaje que cualquier ejecutivo puede entender.