Multimodal de forma nativa
Texto, imagen, vídeo y audio aceptados a través de una sola interfaz.
El modelo de vídeo multimodal nativo de Google, que acepta texto, imágenes, vídeo y audio como entrada, ofrecido en Virse como opciones basadas en fotogramas y basadas en referencias.
Abre esta página en un navegador de escritorio para empezar a crear.
Gemini Omni Flash es el modelo de vídeo rápido de Google, anunciado en junio de 2026, y la parte que merece la pena entender es qué aceptará.
La mayoría de los modelos de vídeo reciben una imagen y un párrafo. Este es multimodal de forma nativa: texto, imágenes, vídeo y audio entran todos a través de la misma interfaz, en lugar de mediante adaptadores separados añadidos después. Se trata de una propiedad arquitectónica más que de una lista de funciones, y se nota en la coherencia con la que el modelo concilia entradas que apuntan en direcciones distintas. Google también lo ha creado para el refinamiento conversacional, donde un clip se ajusta continuando la conversación en vez de reescribir el briefing.
Usa Gemini Omni Flash cuando tus entradas sean variadas y tu pipeline de imágenes ya sea de Google. Anima imágenes estáticas de Nano Banana o de modelos de imagen de Gemini, dirige tomas a partir de material de referencia e itera sobre un clip respondiendo a él.

Gemini Omni Flash es un modelo de generación de vídeo con IA desarrollado por Google DeepMind, parte de la línea Gemini Flash, en la que la velocidad de entrega es la prioridad de diseño. Se anunció en junio de 2026 como una opción rentable para la generación de vídeo y la edición de vídeo conversacional.
El modelo se basa en tres grandes puntos fuertes:
Virse enumera dos entradas. Gemini Omni Flash toma un primer fotograma, un último fotograma o ambos, además de un resumen escrito. Gemini Omni Flash Reference funciona en cambio a partir de imágenes de ejemplo suministradas. La entrada ofrecida en Virse es la configuración 720P, que renderiza audio nativo en cada generación, por lo que la dirección de audio no forma parte del resumen aquí.

Texto, imagen, vídeo y audio aceptados a través de una sola interfaz.
Basada en fotogramas y basada en referencias, listadas por separado en Virse.

El tamaño ofrecido en Virse. El audio se genera de forma nativa con la imagen.
Un modelo de la línea Flash, que en vídeo importa más que en imágenes fijas.
Ajusta un resultado continuando la instrucción en lugar de reescribirla.
Una señal imperceptible incrustada en cada clip generado.

La multimodalidad nativa significa que el texto, las imágenes, el vídeo y el audio son gestionados por el mismo modelo en lugar de pasarse por codificadores separados. Las entradas que entrarían en conflicto en un sistema ensamblado se concilian en su lugar.

Veo 3.1, el modelo de vídeo más pesado de Google, funciona por fotogramas. Gemini Omni Flash añade una vía de imagen de referencia, que es la única ruta hacia ese tipo de control de continuidad dentro de la familia de Google.

En lugar de reescribir un briefing desde cero para corregir una cosa, el modelo está diseñado para el ajuste iterativo: la premisa de diseño es que el primer resultado es un punto de partida.

La línea Flash optimiza el tiempo de respuesta. En vídeo, donde una generación lenta rompe por completo la concentración, eso importa más que en las imágenes fijas.

Los fotogramas producidos por Nano Banana Pro, Nano Banana 2 o Gemini 2.5 Flash Image proceden de la misma familia, lo que mantiene el carácter visual continuo en el traspaso de imagen fija a movimiento.

SynthID se integra automáticamente en cada clip, identificándolo como generado por IA sin nada visible en la imagen y sin nada que activar.
Mantenerse dentro de una misma familia de modelos a lo largo de una canalización parece una preferencia hasta que cambias de proveedor en mitad del proyecto y pasas una tarde averiguando por qué la versión animada no coincide con la imagen fija. Virse convierte la ruta de la misma familia en el camino de menor resistencia. Un fotograma generado por cualquier modelo de imagen de Google en el lienzo pasa directamente a Gemini Omni Flash sin exportación, de modo que la transferencia de imagen fija a movimiento ocurre en el mismo lugar.
Envía un fotograma de imagen de Nano Banana o Gemini directamente al modelo de vídeo en el mismo lienzo.

Cada refinamiento se sitúa junto a la versión de la que procede, que es lo que hace que un flujo de trabajo conversacional sea revisable después.

Cambia entre Gemini Omni Flash y más de 30 modelos de imagen y vídeo sin salir del lienzo ni reescribir el briefing.

Ejecuta el mismo fotograma en Veo 3.1 junto a él cuando necesites saber si el peso extra merece la pena.


Movimiento añadido a imágenes generadas en otros lugares de la familia de Google.

Planos en los que un sujeto se define mediante imágenes de ejemplo en lugar de describirse.

Clips rápidos en los que el tiempo de respuesta importa más que la resolución.

Revelaciones y rotaciones sencillas a partir de un fotograma inicial definido.

Referencia en movimiento para una idea de plano antes de comprometerse con nada.

Clips refinados a lo largo de varias rondas en lugar de especificarse perfectamente desde el principio.
Si ya tienes los fotogramas, usa la opción estándar. Si necesitas que un sujeto se mantenga entre clips, usa Reference.
Añade las composiciones, o el conjunto de ejemplos con una tarea indicada para cada imagen.
Describe el movimiento en la escena, el comportamiento de la cámara y el ritmo. El audio se renderiza con la imagen, así que merece la pena incluir indicaciones de diálogo y ambiente.
Ajusta el resultado con una instrucción de seguimiento en lugar de reescribir el briefing original.
Un prompt útil de Gemini Omni Flash suele incluir cuatro elementos:
En lugar de escribir
Una persona abriendo una ventana, movimiento natural agradable, cinematográfico.
Escribe
Una persona está de pie junto a una ventana de guillotina con ambas manos en el marco inferior, vista desde atrás a la altura de la cintura. Empuja la ventana hacia arriba con un movimiento suave hasta que queda totalmente abierta y luego baja las manos. La cámara permanece fija durante todo el tiempo, sin acercamiento ni desplazamiento. Termina con la ventana abierta y los brazos a los lados.

Empieza en la Imagen 1: una taza de té en el alféizar de una ventana, con vapor elevándose y la cortina quieta. Una brisa levanta la cortina desde la derecha durante la primera mitad del clip y luego se posa. El vapor sigue elevándose durante todo el clip. La cámara mantiene un primer plano estático, sin movimiento y sin cortes. Termina en la Imagen 2: la cortina posada, la taza sin cambios.

Usa la persona de la Imagen 1, el delantal de la Imagen 2 y el mostrador de la panadería de la Imagen 3. Él coloca una bandeja de hogazas sobre el mostrador, se endereza y se limpia las manos en el delantal. Un plano medio fijo desde el lado del cliente del mostrador, con la cámara inmóvil. Conserva su rostro, su pelo y el color y el corte del delantal exactamente como se muestran. Termina con sus manos a los lados.

Una bicicleta apoyada contra una pared de ladrillo pintada, vista de frente. Nada en la escena se mueve. La cámara se desplaza lentamente hacia la izquierda a una velocidad constante, manteniendo la bicicleta en el encuadre y revelando una puerta a su derecha. Luz uniforme de cielo nublado durante toda la escena. Termina con la bicicleta en el borde derecho y la puerta centrada.
| Dimensión | Gemini Omni Flash | Veo 3.1 |
|---|---|---|
| Tipos de entrada | Texto, imagen, vídeo y audio | Texto y fotogramas |
| Entrada Reference | Sí, aparece por separado | No |
| Salida en Virse | 720P, sin sonido | De 720p a 4K, audio opcional |
| Objetivo de diseño | Velocidad de entrega | Límite de salida |
| Construcción de secuencias | Refinamiento conversacional | Extensión de escena |
| Elígelo cuando | Las entradas son variadas o un sujeto debe mantenerse | La pieza necesita duración, audio o 4K |
Da al movimiento un inicio y un final claros en lugar de una descripción abierta.
En la entrada Reference, indica qué imagen aporta el sujeto y cuál aporta el entorno.
Las imágenes de Nano Banana o Gemini 2.5 Flash Image se transfieren a este modelo sin ningún cambio en su carácter visual.
El modelo está diseñado para instrucciones de seguimiento. Reescribir todo el briefing descarta lo que ya funcionaba.
Anima los fotogramas que ya han producido tus modelos de imagen de la familia de Google, o dirige la toma a partir de un conjunto de referencia, sin salir del lienzo en ningún caso.