Google presentó el 27 de agosto de 2026 Gemini Omni 1.1 Flash, una actualización orientada a producción que incorpora nuevos controles para la generación de vídeo. El modelo está disponible para desarrolladores a través de la API de Gemini en Google AI Studio y de Gemini Enterprise Agent Platform.
La principal novedad es la posibilidad de extender escenas a partir de un vídeo existente. Gemini Omni 1.1 Flash puede analizar hasta 10 segundos de contexto previo, frente al último segundo que utilizaban modelos anteriores, para continuar la secuencia con mayor consistencia visual y continuidad narrativa. Las extensiones se generan en tramos de 10 segundos, hasta alcanzar una duración acumulada máxima de 40 segundos.
Esta función permite continuar una historia desde el punto en el que termina un clip, mantener los elementos de la escena o abrir nuevas direcciones creativas. Google la presenta como una herramienta para crear secuencias más largas y controlar movimientos de cámara mediante instrucciones de texto, como desplazamientos, zooms, órbitas alrededor de un personaje o cambios de perspectiva.
Gemini Omni 1.1 Flash también permite especificar el primer y el último fotograma de una toma. El modelo genera el vídeo intermedio entre ambos fotogramas clave, una capacidad pensada para construir transiciones complejas, movimientos de cámara y bucles con una continuidad más precisa. Entre los usos mostrados por Google se incluyen transiciones en un único plano, acercamientos y alejamientos de cámara y cambios de escena sin cortes visibles.
Para acelerar la fase de pruebas, los desarrolladores pueden generar vídeos preliminares en resolución de 360p. Según Google, estas previsualizaciones se producen hasta un 60% más rápido y cuestan un tercio de lo que cuesta generar vídeos en la resolución estándar de 720p de Omni 1.1. La compañía orienta esta opción a la creación rápida de prototipos, la iteración de storyboards y las pruebas de flujos creativos antes de renderizar el resultado final.
Una vez validado el contenido, el modelo permite escalar los vídeos hasta 1080p o 4K para obtener salidas preparadas para producción profesional. Google mostró ejemplos con seguimiento de peces, animales en movimiento y primeros planos de hojas de arce, además de escenas con texturas detalladas y profundidad de campo reducida.
La actualización añade asimismo la posibilidad de incluir referencias de vídeo en la entrada multimodal. Los desarrolladores pueden aportar hasta tres segundos de vídeo para conservar el contexto visual y la consistencia de los personajes al construir una nueva escena. Google plantea esta función para combinar referencias de movimiento con personajes y entornos definidos por el usuario.
El acceso a estas capacidades se realiza mediante la API de Gemini. En el ejemplo publicado por Google, una interacción usa el modelo “gemini-omni-1.1-flash”, enlaza con una interacción de vídeo anterior y solicita continuar la escena con una respuesta configurada a 360p. La actualización está dirigida a quienes desarrollan flujos de generación de vídeo, herramientas creativas y software de edición multimedia.
Fuente: Google.