Cuatro, seis u ocho segundos
Duración de generación seleccionable por clip.
Veo 3.1 de Google DeepMind genera clips cortos con audio sincronizado de 48kHz y los amplía en secuencias más largas llevando los fotogramas finales hacia delante.
Abre esta página en un navegador de escritorio para empezar a crear.
Veo 3.1 es el modelo de vídeo de Google DeepMind y adopta un enfoque diferente de la duración respecto a la mayor parte del sector.
En lugar de alargar una única generación, produce clips de cuatro, seis u ocho segundos y luego los amplía: los fotogramas finales de un clip se convierten en el inicio del siguiente, de modo que una secuencia crece plano a plano con continuidad en cada unión. Esa estructura te ofrece un punto de decisión entre cada segmento, en lugar de una única tirada de dados prolongada, lo que supone una forma significativamente distinta de crear una pieza de vídeo.
Usa Veo 3.1 cuando el resultado final sea más largo que un único plano. Monta secuencias narrativas, vídeos de campaña, recorridos explicativos y cualquier pieza en la que la segunda mitad dependa de cómo haya quedado la primera.

Veo 3.1 es un modelo de generación de vídeo con IA desarrollado por Google DeepMind, ofrecido en Virse junto con una variante de menor coste llamada Veo 3.1 Fast. Ambos aceptan un primer fotograma, un último fotograma o ambos, junto con un briefing escrito.
El modelo se basa en tres grandes puntos fuertes:
Las generaciones duran cuatro, seis u ocho segundos, en 16:9 y en vertical 9:16. Las dos opciones difieren en coste y calidad de renderizado, no en lo que aceptan, por lo que un briefing escrito para una funciona sin cambios en la otra.

Duración de generación seleccionable por clip.
Los fotogramas finales de un clip se convierten en el inicio del siguiente.
Salida real de 3840×2160, con 1080p y 720p por debajo.
Diálogo, efectos de sonido y ruido ambiental generados junto con la imagen.
Horizontal y vertical a partir del mismo briefing escrito.
Veo 3.1 y Veo 3.1 Fast, con entradas idénticas.
La extensión de escena convierte la duración en una serie de decisiones en lugar de un único compromiso. Si el segmento tres sale mal, regeneras el segmento tres, no toda la pieza.
Como la extensión parte de los fotogramas finales del clip anterior, el sujeto, la iluminación y el entorno se mantienen a través del corte en lugar de volver a derivarse de una descripción.
A 48 kHz en estéreo, el sonido tiene una especificación que resiste una edición real en lugar de necesitar ser sustituido antes de que nada salga al aire.
Cuatro, seis u ocho segundos es una elección real, y es importante porque el ritmo lo marca más la duración que cualquier otra cosa del briefing.
3840×2160 renderizado directamente, para trabajos que se proyectarán, se recortarán o se entregarán a tamaño completo.
Veo 3.1 Fast acepta entradas idénticas, por lo que la pasada exploratoria y la pasada de entrega son el mismo prompt en entradas diferentes.
Una secuencia encadenada solo es manejable si puedes ver la cadena. El segmento cuatro se construye sobre el segmento tres, y si se sustituye el segmento tres, todo lo posterior debe volver a revisarse. Virse mantiene toda la ejecución dispuesta en orden en un único lienzo. Cada extensión se sitúa después del clip del que procede, de modo que la estructura de la secuencia permanece visible en lugar de depender de una convención de nombres de archivo.
Cada segmento se sitúa junto al que extiende, lo que hace que una unión defectuosa sea evidente de un vistazo.
Sustituye un enlace de la cadena y reconstruye hacia delante desde ahí en lugar de volver a empezar toda la pieza.
Muévete entre Veo 3.1 y más de 30 modelos de imagen y vídeo sin salir del lienzo ni reescribir el briefing.
Produce el fotograma de establecimiento con un modelo de imagen en el mismo espacio de trabajo e inicia la cadena a partir de él.
Piezas multisegmento ensambladas plano a plano con continuidad entre las uniones.
Vídeo de marca creado con una duración que una sola generación no puede alcanzar.
Demostraciones ampliadas que mantienen el producto de forma coherente de un segmento a otro.
Metraje de localización en el que el ambiente aporta tanto como la imagen.
Salida 9:16 para feeds, a partir del mismo briefing que la versión horizontal.
Storyboards convertidos en referencia en movimiento, ampliados hasta secuencias completas.
Fast para exploración, la opción estándar para entrega. Elige cuatro, seis u ocho segundos según el ritmo que quieras.
Sube la composición con la que empieza la secuencia, y la final si el plano tiene que terminar en un punto concreto.
Indica el movimiento, el comportamiento de la cámara y la mezcla, y especifica cómo termina el segmento.
Usa los fotogramas finales para generar el plano siguiente y revisa cada unión antes de continuar.
Un prompt útil para Veo 3.1 suele incluir cinco elementos:
En lugar de escribir
Un plano dramático de olas golpeando rocas, cinematográfico, con música épica.
Escribe
Un plano general de olas grises rompiendo contra roca volcánica negra bajo una luz nublada. Cada mar de fondo se eleva y se derrumba a un ritmo pausado, con la espuma desplazándose hacia la derecha por el viento. Cámara fija sobre un trípode, ligeramente por encima de la línea de flotación. El audio es solo agua y viento, sin música. Termina con una ola retirándose y dejando la roca reluciente.
Abre con la composición de la Imagen 1: una gasolinera rural al anochecer, una sola luz de la marquesina encendida, sin coches y sin gente. Los insectos se mueven a través del haz de luz de la marquesina. Todo lo demás permanece quieto. La cámara se desplaza lentamente hacia la derecha a velocidad constante, manteniendo la marquesina en plano en todo momento. Cigarras, el zumbido eléctrico de la luz, un vehículo lejano que pasa sin aparecer. Sin música. Termina con la marquesina en el borde izquierdo y la carretera abierta ocupando la derecha.
Abre con unos auriculares circumaurales cerrados sobre una superficie de nogal oscuro, iluminados por una única fuente situada arriba y detrás. Los cascos giran para abrirse lenta y uniformemente durante los dos primeros segundos mientras la cámara avanza una corta distancia y se detiene. Tono ambiente bajo con un suave clic mecánico cuando los cascos alcanzan su posición abierta. Sin música. Termina con los auriculares completamente abiertos, ocupando la mitad inferior del encuadre.
Un hombre con una chaqueta de lona está de pie en el pasillo de una ferretería, sosteniendo un bote de pintura y leyendo la etiqueta. Levanta la mirada hacia alguien fuera de cámara y dice: "Esta es la mate, ¿verdad?" Cámara estática en un plano medio desde el final del pasillo, sin movimiento. Zumbido fluorescente, ruido lejano de estanterías, su voz a nivel de conversación, sin música. Termina con él volviendo a mirar el bote.
| Dimensión | Veo 3.1 Fast | Veo 3.1 |
|---|---|---|
| Orientado a | Exploración y temporización | Entrega |
| Entradas | Idéntico al estándar | Idéntico a Fast |
| Duraciones de clip | Cuatro, seis u ocho segundos | Cuatro, seis u ocho segundos |
| Extensión de escena | Sí | Sí |
| Audio | Opcional, estéreo 48kHz | Opcional, estéreo 48kHz |
| Rango de salida | 720p a 4K | 720p a 4K |
El estado de cierre se convierte en la apertura del siguiente segmento. Un final poco definido se propaga por todo lo que construyas después.
Comprueba la transición entre segmentos antes de generar el siguiente. Los errores se agravan a lo largo de una cadena.
"Sin música, solo tono de sala y pasos" es dirigible. "Banda sonora épica" es una sensación que el modelo tiene que adivinar.
De cuatro a ocho segundos sostienen una sola acción. Apilar eventos es precisamente lo que la segmentación pretende evitar.
Construye la secuencia por partes, revisa cada unión y conserva los puntos de decisión que una única generación larga te quitaría.