Gemini ya explora videos como un agente que planifica, observa y razona para responder

Google presenta Gemini con comprensión de video agente mientras la investigación (AVP) y los nuevos benchmarks (VideoGAIA) redefinen el estándar: iterar, buscar evidencia y razonar, no solo subtitular.

Gemini ya explora videos como un agente que planifica, observa y razona para responder

Foto: BoliviaInteligente

Un video de tres horas llega a la mesa de un ejecutivo. La pregunta no es "qué pasa", sino "en qué minuto el proveedor menciona la cláusula de penalidad y qué muestra la pantalla en ese momento". Hasta hace poco, la respuesta exigía verlo todo o confiar en subtítulos automáticos que pierden el detalle. Eso cambia esta semana.

De subtitular a investigar

El blog de Google DeepMind presenta la comprensión de video agente en Gemini: el modelo deja de tratar el video como un bloque fijo y pasa a explorarlo como un entorno interactivo. En lugar de generar subtítulos exhaustivos —costosos y ruidosos—, planifica qué buscar, observa segmentos concretos y reflexiona si la evidencia basta. Si no, itera.

Patrocinado Advertisement

La misma lógica sostiene Active Video Perception (AVP), el marco de Salesforce Research presentado en CVPR 2026. AVP ejecuta un bucle planificar–observar–reflexionar con agentes MLLM. En cinco benchmarks de video largo (MINERVA, LVBench, Video-MME, MLVU, LongVideoBench) supera al mejor método agente previo (Deep Video Discovery) en 5,7 puntos de precisión media usando apenas el 18,4 % del tiempo de inferencia y el 12,4 % de los tokens de entrada Active Video Perception.

El techo de los benchmarks tradicionales

Video-MME, MLVU y VideoMMMU ya rozan el 90 % de acierto con los modelos frontera. El problema: miden respuesta única, mundo cerrado, sin herramientas. VideoGAIA, creado por la Universidad China de Hong Kong, Ant Group y Tsinghua, rompe ese techo. Propone 271 tareas multi-turno, verificadas por tres expertos cada una, donde el modelo debe inspeccionar el video, buscar en la web, leer páginas y sintetizar evidencia a lo largo de varios pasos. Los 20 modelos frontera evaluados (incluidos GPT-5.5 y Kimi-K3) no superan el 60 % VideoGAIA.

La brecha entre el 90 % del paradigma antiguo y el 60 % del nuevo revela la distancia real: saber mirar no basta; hay que saber buscar, decidir cuándo parar y combinar fuentes.

Dos caras del mismo motor

Mientras la línea de investigación (AVP, VideoGAIA) empuja la comprensión, la línea de producto empuja la generación. Gemini Omni 1.1 Flash extiende clips profesionales a 40 segundos, interpola primer y último fotograma para transiciones fluidas, previsualiza en 360p al 60 % de velocidad y un tercio de coste, y escala a 4K nativo Europa Press. Paralelamente, Gemini Robotics ER 2 expone una API de interacciones con razonamiento espacial, búsqueda de momentos en video, clasificación de progreso y orquestación multi-robot, disponible en modalidad estándar y streaming de baja latencia Google AI for Developers.

Ambas vías —entender y crear— comparten la apuesta por el control granular del tiempo y la atención selectiva.

Qué cambia para una empresa en LatAm

1. Coste por minuto analizado. AVP demuestra que se puede razonar sobre video largo con una fracción de tokens. En la nube, eso se traduce en facturas de inferencia drásticamente menores para casos como auditoría de cámaras de seguridad, revisión de grabaciones de atención al cliente o monitoreo de cosechas con drones. 2. Privacidad y soberanía. Los bucles agente pueden ejecutarse on-device o en nubes locales (Google Cloud tiene regiones en Santiago, São Paulo y México). El video sensible no sale del perímetro; solo viajan las evidencias textuales mínimas.

3. Talento y herramienta. Los SDKs de Gemini Robotics ER y la API de Live ya aceptan Python y REST estándar. Un equipo de datos medianamente curtido puede prototipar un agente que inspeccione grabaciones de fábrica, detecte anomalías y dispare alertas en Slack sin entrenar modelos propios. 4. Regulación incipiente. Brasil (LGPD), Chile (nueva ley de datos) y México (LFPDPPP) exigen minimización y finalidad. Una arquitectura que solo extrae evidencia relevante —y no el video completo— encaja mejor en el principio de minimización que los pipelines de subtitulado masivo.

El siguiente umbral

VideoGAIA muestra que aun con herramientas, los mejores modelos fallan el 40 % de las tareas reales. La investigación (AVP) y el producto (Gemini Omni, Robotics ER) convergen en la misma idea: el video deja de ser un archivo para convertirse en un entorno que se interroga. Para el ejecutivo latinoamericano, la pregunta operativa ya no es "¿tenemos GPU?" sino "¿qué proceso de negocio se resuelve si un agente encuentra la aguja en el pajar de video sin ver la paja?"

Fuentes

  1. Presentamos la comprensión de video agente con Gemini
  2. Percepción activa de video: búsqueda iterativa de evidencias para la comprensión agente de video largo
  3. VideoGAIA: Un benchmark para asistentes de IA generales en la comprensión de video agente
  4. Gemini Robotics ER - API de Interacciones | Google IA para Desarrolladores
  5. Gemini Omni 1.1 Flash llega con mejoras para extender los clips de vídeo profesionales hasta 40 segundos
Bryan Brea

Escrito por

Bryan Brea

Abogado y comunicador

Abogado, broadcaster y comunicador dominicano, reconocido por una trayectoria que combina voz, criterio público y presencia en escenarios de comunicación social. Como locutor internacional, ha sido distinguido en espacios como Praise Music y Premios Galardón, además de figurar como nominado al Micrófono de Oro, reflejando una labor sostenida en la palabra hablada, la conducción y la conexión con audiencias. Su perfil proyecta a un profesional versátil, con vocación comunicacional, capacidad de influencia y una presencia pública construida desde la credibilidad, la cercanía y el compromiso con mensajes de valor.